diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ecc036e87349a639d0327c993d0322670cb2d0ba --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-100/trainer_state.json @@ -0,0 +1,139 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.24140012070006034, + "eval_steps": 20, + "global_step": 100, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0127318221037568e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e10c9c9fe4bbaf8b65e834d596218c06404ac1d3 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1000/trainer_state.json @@ -0,0 +1,1084 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.4103802051901027, + "eval_steps": 20, + "global_step": 1000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0031683194745037e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f329bbea390a413dc66bf985259ab8dab4b275b2 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1020/trainer_state.json @@ -0,0 +1,1105 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.4586602293301145, + "eval_steps": 20, + "global_step": 1020, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0239715575080755e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8d1c79dc08fd89585fd8cc3a71aef55bc9f9595e --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1040/trainer_state.json @@ -0,0 +1,1126 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.506940253470127, + "eval_steps": 20, + "global_step": 1040, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0435065133937664e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0111253307a79c355d8c8126917897c83baa926b --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1060/trainer_state.json @@ -0,0 +1,1147 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.5552202776101387, + "eval_steps": 20, + "global_step": 1060, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0627093642584269e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0257f34da4b8f3e993d73c4d394376bfa5547352 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1080/trainer_state.json @@ -0,0 +1,1168 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.603500301750151, + "eval_steps": 20, + "global_step": 1080, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0829722584469709e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..275a789139d75e8da3fd3217959dd0f26bcf863f --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1100/trainer_state.json @@ -0,0 +1,1189 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.651780325890163, + "eval_steps": 20, + "global_step": 1100, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.102976649267794e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4198fd69705d2296cbfd15be632f706c18195298 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1120/trainer_state.json @@ -0,0 +1,1210 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.700060350030175, + "eval_steps": 20, + "global_step": 1120, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.123058232066478e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..46038d46b4e3b8a28d223c56bb29038a5f1735e2 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1140/trainer_state.json @@ -0,0 +1,1231 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.748340374170187, + "eval_steps": 20, + "global_step": 1140, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.141886791596626e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a8dce921e9db896b938d62e71a0cb7ccf6d7bab0 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1160/trainer_state.json @@ -0,0 +1,1252 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.796620398310199, + "eval_steps": 20, + "global_step": 1160, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1627016981849907e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..09d11725f6f4868c08785f0f31f647d59e525eea --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1180/trainer_state.json @@ -0,0 +1,1273 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.8449004224502112, + "eval_steps": 20, + "global_step": 1180, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1821567693494067e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f131523f6622afe9f5febb16b447632b7c852cbd --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-120/trainer_state.json @@ -0,0 +1,160 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.28968014484007243, + "eval_steps": 20, + "global_step": 120, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2278999724859392e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e4f56b396f4cf722f14498333e1513140cf50226 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1200/trainer_state.json @@ -0,0 +1,1294 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.8931804465902236, + "eval_steps": 20, + "global_step": 1200, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.202393633684951e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0f861783a8513552d6db099d26e9e700ed1ef3a0 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1220/trainer_state.json @@ -0,0 +1,1315 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.9414604707302354, + "eval_steps": 20, + "global_step": 1220, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.22275795454208e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0ba6d4f23ebf4c7f726c8e6fb64e39b4db05eec9 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1240/trainer_state.json @@ -0,0 +1,1336 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.9897404948702473, + "eval_steps": 20, + "global_step": 1240, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2419491368519475e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ed4e1da389ad8d604f86c0c4b5e35136799f708e --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1260/trainer_state.json @@ -0,0 +1,1357 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.036210018105009, + "eval_steps": 20, + "global_step": 1260, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2612962738845286e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..57a0658bbf82b1e95bf74bf042c63bae5361b7ec --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1280/trainer_state.json @@ -0,0 +1,1378 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.084490042245021, + "eval_steps": 20, + "global_step": 1280, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2835248707651174e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2f0affb86e303161e5006b41ff37058a58fcc41e --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1300/trainer_state.json @@ -0,0 +1,1399 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.1327700663850333, + "eval_steps": 20, + "global_step": 1300, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3048837115230618e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..dd41560cc02589cf90577156d8b7c800a2e5af28 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1320/trainer_state.json @@ -0,0 +1,1420 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.181050090525045, + "eval_steps": 20, + "global_step": 1320, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.326625819426898e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f4acabad58753fbfbc178d0b9274e94dbc689bdd --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1340/trainer_state.json @@ -0,0 +1,1441 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.2293301146650575, + "eval_steps": 20, + "global_step": 1340, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.345957024394281e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c043b7a028490c807463aab4b8fc8966566842fd --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1360/trainer_state.json @@ -0,0 +1,1462 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.2776101388050694, + "eval_steps": 20, + "global_step": 1360, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3663042912097894e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..957854d293c6f9d48ee1d82af92b96066ed35c91 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1380/trainer_state.json @@ -0,0 +1,1483 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.3258901629450817, + "eval_steps": 20, + "global_step": 1380, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3850107797051802e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5b282ec27f6c30aaece0783991f4d868e9b437be --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-140/trainer_state.json @@ -0,0 +1,181 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.33796016898008446, + "eval_steps": 20, + "global_step": 140, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4496025135521792e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ebaff554059785743429b837a43e2e40054c9854 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1400/trainer_state.json @@ -0,0 +1,1504 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.3741701870850935, + "eval_steps": 20, + "global_step": 1400, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4040125723949466e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2e3a96db25b559fbbfd20878c9621d4d63eba4b9 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1420/trainer_state.json @@ -0,0 +1,1525 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.4224502112251054, + "eval_steps": 20, + "global_step": 1420, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4238859163696333e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e1f02caa202e9bd6910bd5befa5f3b552788b5f4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1440/trainer_state.json @@ -0,0 +1,1546 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.4707302353651177, + "eval_steps": 20, + "global_step": 1440, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4433804811041178e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..11d416f646df5ae460a1f9adf36551579293eb1d --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1460/trainer_state.json @@ -0,0 +1,1567 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.51901025950513, + "eval_steps": 20, + "global_step": 1460, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.463979070638244e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..70d1d09b0ae9c0b9a0c79e64cf64569035fc29b5 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1480/trainer_state.json @@ -0,0 +1,1588 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.567290283645142, + "eval_steps": 20, + "global_step": 1480, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4846844723277824e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4388d2e8803dc4c690037a01a10761ff8ca98509 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1500/trainer_state.json @@ -0,0 +1,1609 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.6155703077851538, + "eval_steps": 20, + "global_step": 1500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.504547942909952e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..85d87221ccc2fb5905a3a31bdc863756b734e02a --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1520/trainer_state.json @@ -0,0 +1,1630 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.663850331925166, + "eval_steps": 20, + "global_step": 1520, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5236305179021312e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b21ffc7cc9e7cf80527877e44e9aaf6ffa7f1d36 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1540/trainer_state.json @@ -0,0 +1,1651 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.712130356065178, + "eval_steps": 20, + "global_step": 1540, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + }, + { + "entropy": 0.5455610822886229, + "epoch": 3.712130356065178, + "grad_norm": 0.7269843220710754, + "learning_rate": 0.0002891155191539905, + "loss": 0.5407682895660401, + "mean_token_accuracy": 0.8393648222088814, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.6032205542151847, + "eval_loss": 0.6790974140167236, + "eval_mean_token_accuracy": 0.8165463112043531, + "eval_num_tokens": 3569036.0, + "eval_runtime": 89.517, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1540 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.544052283952087e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f23b17b0fc8777d6f3a042c826c3da2338e99c9e --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1560/trainer_state.json @@ -0,0 +1,1672 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.7604103802051903, + "eval_steps": 20, + "global_step": 1560, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + }, + { + "entropy": 0.5455610822886229, + "epoch": 3.712130356065178, + "grad_norm": 0.7269843220710754, + "learning_rate": 0.0002891155191539905, + "loss": 0.5407682895660401, + "mean_token_accuracy": 0.8393648222088814, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.6032205542151847, + "eval_loss": 0.6790974140167236, + "eval_mean_token_accuracy": 0.8165463112043531, + "eval_num_tokens": 3569036.0, + "eval_runtime": 89.517, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1540 + }, + { + "entropy": 0.5474163968116045, + "epoch": 3.7604103802051903, + "grad_norm": 0.8148866295814514, + "learning_rate": 0.00028661336281380717, + "loss": 0.5394441604614257, + "mean_token_accuracy": 0.8336028568446636, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5797032238392348, + "eval_loss": 0.670870304107666, + "eval_mean_token_accuracy": 0.8182691593518417, + "eval_num_tokens": 3614313.0, + "eval_runtime": 89.4468, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.99, + "step": 1560 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5635917277434675e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c1375941d51c9a44bb7ae7cfb11a9ff8ab5ce42b --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1580/trainer_state.json @@ -0,0 +1,1693 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.808690404345202, + "eval_steps": 20, + "global_step": 1580, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + }, + { + "entropy": 0.5455610822886229, + "epoch": 3.712130356065178, + "grad_norm": 0.7269843220710754, + "learning_rate": 0.0002891155191539905, + "loss": 0.5407682895660401, + "mean_token_accuracy": 0.8393648222088814, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.6032205542151847, + "eval_loss": 0.6790974140167236, + "eval_mean_token_accuracy": 0.8165463112043531, + "eval_num_tokens": 3569036.0, + "eval_runtime": 89.517, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1540 + }, + { + "entropy": 0.5474163968116045, + "epoch": 3.7604103802051903, + "grad_norm": 0.8148866295814514, + "learning_rate": 0.00028661336281380717, + "loss": 0.5394441604614257, + "mean_token_accuracy": 0.8336028568446636, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5797032238392348, + "eval_loss": 0.670870304107666, + "eval_mean_token_accuracy": 0.8182691593518417, + "eval_num_tokens": 3614313.0, + "eval_runtime": 89.4468, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.99, + "step": 1560 + }, + { + "entropy": 0.5511750865727663, + "epoch": 3.808690404345202, + "grad_norm": 1.3441656827926636, + "learning_rate": 0.0002840817043244964, + "loss": 0.5378933906555176, + "mean_token_accuracy": 0.8349151819944381, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5297858750217417, + "eval_loss": 0.680833637714386, + "eval_mean_token_accuracy": 0.8180924275617921, + "eval_num_tokens": 3659786.0, + "eval_runtime": 89.5417, + "eval_samples_per_second": 15.859, + "eval_steps_per_second": 1.988, + "step": 1580 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.58275059713237e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d04df3a93d23b659196202f272ca014cff2246a2 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-160/trainer_state.json @@ -0,0 +1,202 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.38624019312009655, + "eval_steps": 20, + "global_step": 160, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.6420618611449856e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ed6fb502590ff22047fec334cfb36728afd7a77f --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1600/trainer_state.json @@ -0,0 +1,1714 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.856970428485214, + "eval_steps": 20, + "global_step": 1600, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + }, + { + "entropy": 0.5455610822886229, + "epoch": 3.712130356065178, + "grad_norm": 0.7269843220710754, + "learning_rate": 0.0002891155191539905, + "loss": 0.5407682895660401, + "mean_token_accuracy": 0.8393648222088814, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.6032205542151847, + "eval_loss": 0.6790974140167236, + "eval_mean_token_accuracy": 0.8165463112043531, + "eval_num_tokens": 3569036.0, + "eval_runtime": 89.517, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1540 + }, + { + "entropy": 0.5474163968116045, + "epoch": 3.7604103802051903, + "grad_norm": 0.8148866295814514, + "learning_rate": 0.00028661336281380717, + "loss": 0.5394441604614257, + "mean_token_accuracy": 0.8336028568446636, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5797032238392348, + "eval_loss": 0.670870304107666, + "eval_mean_token_accuracy": 0.8182691593518417, + "eval_num_tokens": 3614313.0, + "eval_runtime": 89.4468, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.99, + "step": 1560 + }, + { + "entropy": 0.5511750865727663, + "epoch": 3.808690404345202, + "grad_norm": 1.3441656827926636, + "learning_rate": 0.0002840817043244964, + "loss": 0.5378933906555176, + "mean_token_accuracy": 0.8349151819944381, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5297858750217417, + "eval_loss": 0.680833637714386, + "eval_mean_token_accuracy": 0.8180924275617921, + "eval_num_tokens": 3659786.0, + "eval_runtime": 89.5417, + "eval_samples_per_second": 15.859, + "eval_steps_per_second": 1.988, + "step": 1580 + }, + { + "entropy": 0.5379613988101483, + "epoch": 3.856970428485214, + "grad_norm": 0.9813932776451111, + "learning_rate": 0.00028152126011546396, + "loss": 0.5340342044830322, + "mean_token_accuracy": 0.8346010789275169, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5811898510777549, + "eval_loss": 0.6764267683029175, + "eval_mean_token_accuracy": 0.8180528236239144, + "eval_num_tokens": 3706362.0, + "eval_runtime": 88.7831, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 1600 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.6031894172239462e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b52b40f924bd4c06c11b91332f1fabc8db1b37a0 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1620/trainer_state.json @@ -0,0 +1,1735 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.9052504526252263, + "eval_steps": 20, + "global_step": 1620, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + }, + { + "entropy": 0.5455610822886229, + "epoch": 3.712130356065178, + "grad_norm": 0.7269843220710754, + "learning_rate": 0.0002891155191539905, + "loss": 0.5407682895660401, + "mean_token_accuracy": 0.8393648222088814, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.6032205542151847, + "eval_loss": 0.6790974140167236, + "eval_mean_token_accuracy": 0.8165463112043531, + "eval_num_tokens": 3569036.0, + "eval_runtime": 89.517, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1540 + }, + { + "entropy": 0.5474163968116045, + "epoch": 3.7604103802051903, + "grad_norm": 0.8148866295814514, + "learning_rate": 0.00028661336281380717, + "loss": 0.5394441604614257, + "mean_token_accuracy": 0.8336028568446636, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5797032238392348, + "eval_loss": 0.670870304107666, + "eval_mean_token_accuracy": 0.8182691593518417, + "eval_num_tokens": 3614313.0, + "eval_runtime": 89.4468, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.99, + "step": 1560 + }, + { + "entropy": 0.5511750865727663, + "epoch": 3.808690404345202, + "grad_norm": 1.3441656827926636, + "learning_rate": 0.0002840817043244964, + "loss": 0.5378933906555176, + "mean_token_accuracy": 0.8349151819944381, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5297858750217417, + "eval_loss": 0.680833637714386, + "eval_mean_token_accuracy": 0.8180924275617921, + "eval_num_tokens": 3659786.0, + "eval_runtime": 89.5417, + "eval_samples_per_second": 15.859, + "eval_steps_per_second": 1.988, + "step": 1580 + }, + { + "entropy": 0.5379613988101483, + "epoch": 3.856970428485214, + "grad_norm": 0.9813932776451111, + "learning_rate": 0.00028152126011546396, + "loss": 0.5340342044830322, + "mean_token_accuracy": 0.8346010789275169, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5811898510777549, + "eval_loss": 0.6764267683029175, + "eval_mean_token_accuracy": 0.8180528236239144, + "eval_num_tokens": 3706362.0, + "eval_runtime": 88.7831, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 1600 + }, + { + "entropy": 0.5607876226305961, + "epoch": 3.9052504526252263, + "grad_norm": 0.9617928266525269, + "learning_rate": 0.00027893275476213383, + "loss": 0.5434338569641113, + "mean_token_accuracy": 0.8332898400723934, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5474644318390428, + "eval_loss": 0.6740226745605469, + "eval_mean_token_accuracy": 0.8185851306058047, + "eval_num_tokens": 3753013.0, + "eval_runtime": 89.3246, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.993, + "step": 1620 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.6233042105247334e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d4e98591dd813af138359498f4ffb138190852d2 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1640/trainer_state.json @@ -0,0 +1,1756 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.9535304767652386, + "eval_steps": 20, + "global_step": 1640, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + }, + { + "entropy": 0.5455610822886229, + "epoch": 3.712130356065178, + "grad_norm": 0.7269843220710754, + "learning_rate": 0.0002891155191539905, + "loss": 0.5407682895660401, + "mean_token_accuracy": 0.8393648222088814, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.6032205542151847, + "eval_loss": 0.6790974140167236, + "eval_mean_token_accuracy": 0.8165463112043531, + "eval_num_tokens": 3569036.0, + "eval_runtime": 89.517, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1540 + }, + { + "entropy": 0.5474163968116045, + "epoch": 3.7604103802051903, + "grad_norm": 0.8148866295814514, + "learning_rate": 0.00028661336281380717, + "loss": 0.5394441604614257, + "mean_token_accuracy": 0.8336028568446636, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5797032238392348, + "eval_loss": 0.670870304107666, + "eval_mean_token_accuracy": 0.8182691593518417, + "eval_num_tokens": 3614313.0, + "eval_runtime": 89.4468, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.99, + "step": 1560 + }, + { + "entropy": 0.5511750865727663, + "epoch": 3.808690404345202, + "grad_norm": 1.3441656827926636, + "learning_rate": 0.0002840817043244964, + "loss": 0.5378933906555176, + "mean_token_accuracy": 0.8349151819944381, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5297858750217417, + "eval_loss": 0.680833637714386, + "eval_mean_token_accuracy": 0.8180924275617921, + "eval_num_tokens": 3659786.0, + "eval_runtime": 89.5417, + "eval_samples_per_second": 15.859, + "eval_steps_per_second": 1.988, + "step": 1580 + }, + { + "entropy": 0.5379613988101483, + "epoch": 3.856970428485214, + "grad_norm": 0.9813932776451111, + "learning_rate": 0.00028152126011546396, + "loss": 0.5340342044830322, + "mean_token_accuracy": 0.8346010789275169, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5811898510777549, + "eval_loss": 0.6764267683029175, + "eval_mean_token_accuracy": 0.8180528236239144, + "eval_num_tokens": 3706362.0, + "eval_runtime": 88.7831, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 1600 + }, + { + "entropy": 0.5607876226305961, + "epoch": 3.9052504526252263, + "grad_norm": 0.9617928266525269, + "learning_rate": 0.00027893275476213383, + "loss": 0.5434338569641113, + "mean_token_accuracy": 0.8332898400723934, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5474644318390428, + "eval_loss": 0.6740226745605469, + "eval_mean_token_accuracy": 0.8185851306058047, + "eval_num_tokens": 3753013.0, + "eval_runtime": 89.3246, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.5354843523353339, + "epoch": 3.9535304767652386, + "grad_norm": 1.5320990085601807, + "learning_rate": 0.0002763169207809021, + "loss": 0.5251852989196777, + "mean_token_accuracy": 0.8416872084140777, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.5436856410141742, + "eval_loss": 0.6675190925598145, + "eval_mean_token_accuracy": 0.8202396507343549, + "eval_num_tokens": 3800024.0, + "eval_runtime": 89.6328, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.986, + "step": 1640 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.6434764490183475e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..da84d5f35ebd04d3e3010e4a2ea6c306fadc3b5f --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1660/trainer_state.json @@ -0,0 +1,1777 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.0, + "eval_steps": 20, + "global_step": 1660, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + }, + { + "entropy": 0.5455610822886229, + "epoch": 3.712130356065178, + "grad_norm": 0.7269843220710754, + "learning_rate": 0.0002891155191539905, + "loss": 0.5407682895660401, + "mean_token_accuracy": 0.8393648222088814, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.6032205542151847, + "eval_loss": 0.6790974140167236, + "eval_mean_token_accuracy": 0.8165463112043531, + "eval_num_tokens": 3569036.0, + "eval_runtime": 89.517, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1540 + }, + { + "entropy": 0.5474163968116045, + "epoch": 3.7604103802051903, + "grad_norm": 0.8148866295814514, + "learning_rate": 0.00028661336281380717, + "loss": 0.5394441604614257, + "mean_token_accuracy": 0.8336028568446636, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5797032238392348, + "eval_loss": 0.670870304107666, + "eval_mean_token_accuracy": 0.8182691593518417, + "eval_num_tokens": 3614313.0, + "eval_runtime": 89.4468, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.99, + "step": 1560 + }, + { + "entropy": 0.5511750865727663, + "epoch": 3.808690404345202, + "grad_norm": 1.3441656827926636, + "learning_rate": 0.0002840817043244964, + "loss": 0.5378933906555176, + "mean_token_accuracy": 0.8349151819944381, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5297858750217417, + "eval_loss": 0.680833637714386, + "eval_mean_token_accuracy": 0.8180924275617921, + "eval_num_tokens": 3659786.0, + "eval_runtime": 89.5417, + "eval_samples_per_second": 15.859, + "eval_steps_per_second": 1.988, + "step": 1580 + }, + { + "entropy": 0.5379613988101483, + "epoch": 3.856970428485214, + "grad_norm": 0.9813932776451111, + "learning_rate": 0.00028152126011546396, + "loss": 0.5340342044830322, + "mean_token_accuracy": 0.8346010789275169, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5811898510777549, + "eval_loss": 0.6764267683029175, + "eval_mean_token_accuracy": 0.8180528236239144, + "eval_num_tokens": 3706362.0, + "eval_runtime": 88.7831, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 1600 + }, + { + "entropy": 0.5607876226305961, + "epoch": 3.9052504526252263, + "grad_norm": 0.9617928266525269, + "learning_rate": 0.00027893275476213383, + "loss": 0.5434338569641113, + "mean_token_accuracy": 0.8332898400723934, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5474644318390428, + "eval_loss": 0.6740226745605469, + "eval_mean_token_accuracy": 0.8185851306058047, + "eval_num_tokens": 3753013.0, + "eval_runtime": 89.3246, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.5354843523353339, + "epoch": 3.9535304767652386, + "grad_norm": 1.5320990085601807, + "learning_rate": 0.0002763169207809021, + "loss": 0.5251852989196777, + "mean_token_accuracy": 0.8416872084140777, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.5436856410141742, + "eval_loss": 0.6675190925598145, + "eval_mean_token_accuracy": 0.8202396507343549, + "eval_num_tokens": 3800024.0, + "eval_runtime": 89.6328, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.986, + "step": 1640 + }, + { + "entropy": 0.5418571938167919, + "epoch": 4.0, + "grad_norm": 4.690354347229004, + "learning_rate": 0.000273674498421843, + "loss": 0.548275089263916, + "mean_token_accuracy": 0.836557479647847, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5497228983747825, + "eval_loss": 0.6621812582015991, + "eval_mean_token_accuracy": 0.8205679802412398, + "eval_num_tokens": 3844304.0, + "eval_runtime": 89.6272, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.986, + "step": 1660 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.6623734491102618e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2aadd1d233280d318896048ad0322373d755ff98 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1680/trainer_state.json @@ -0,0 +1,1798 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.048280024140012, + "eval_steps": 20, + "global_step": 1680, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + }, + { + "entropy": 0.5455610822886229, + "epoch": 3.712130356065178, + "grad_norm": 0.7269843220710754, + "learning_rate": 0.0002891155191539905, + "loss": 0.5407682895660401, + "mean_token_accuracy": 0.8393648222088814, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.6032205542151847, + "eval_loss": 0.6790974140167236, + "eval_mean_token_accuracy": 0.8165463112043531, + "eval_num_tokens": 3569036.0, + "eval_runtime": 89.517, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1540 + }, + { + "entropy": 0.5474163968116045, + "epoch": 3.7604103802051903, + "grad_norm": 0.8148866295814514, + "learning_rate": 0.00028661336281380717, + "loss": 0.5394441604614257, + "mean_token_accuracy": 0.8336028568446636, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5797032238392348, + "eval_loss": 0.670870304107666, + "eval_mean_token_accuracy": 0.8182691593518417, + "eval_num_tokens": 3614313.0, + "eval_runtime": 89.4468, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.99, + "step": 1560 + }, + { + "entropy": 0.5511750865727663, + "epoch": 3.808690404345202, + "grad_norm": 1.3441656827926636, + "learning_rate": 0.0002840817043244964, + "loss": 0.5378933906555176, + "mean_token_accuracy": 0.8349151819944381, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5297858750217417, + "eval_loss": 0.680833637714386, + "eval_mean_token_accuracy": 0.8180924275617921, + "eval_num_tokens": 3659786.0, + "eval_runtime": 89.5417, + "eval_samples_per_second": 15.859, + "eval_steps_per_second": 1.988, + "step": 1580 + }, + { + "entropy": 0.5379613988101483, + "epoch": 3.856970428485214, + "grad_norm": 0.9813932776451111, + "learning_rate": 0.00028152126011546396, + "loss": 0.5340342044830322, + "mean_token_accuracy": 0.8346010789275169, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5811898510777549, + "eval_loss": 0.6764267683029175, + "eval_mean_token_accuracy": 0.8180528236239144, + "eval_num_tokens": 3706362.0, + "eval_runtime": 88.7831, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 1600 + }, + { + "entropy": 0.5607876226305961, + "epoch": 3.9052504526252263, + "grad_norm": 0.9617928266525269, + "learning_rate": 0.00027893275476213383, + "loss": 0.5434338569641113, + "mean_token_accuracy": 0.8332898400723934, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5474644318390428, + "eval_loss": 0.6740226745605469, + "eval_mean_token_accuracy": 0.8185851306058047, + "eval_num_tokens": 3753013.0, + "eval_runtime": 89.3246, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.5354843523353339, + "epoch": 3.9535304767652386, + "grad_norm": 1.5320990085601807, + "learning_rate": 0.0002763169207809021, + "loss": 0.5251852989196777, + "mean_token_accuracy": 0.8416872084140777, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.5436856410141742, + "eval_loss": 0.6675190925598145, + "eval_mean_token_accuracy": 0.8202396507343549, + "eval_num_tokens": 3800024.0, + "eval_runtime": 89.6328, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.986, + "step": 1640 + }, + { + "entropy": 0.5418571938167919, + "epoch": 4.0, + "grad_norm": 4.690354347229004, + "learning_rate": 0.000273674498421843, + "loss": 0.548275089263916, + "mean_token_accuracy": 0.836557479647847, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5497228983747825, + "eval_loss": 0.6621812582015991, + "eval_mean_token_accuracy": 0.8205679802412398, + "eval_num_tokens": 3844304.0, + "eval_runtime": 89.6272, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.986, + "step": 1660 + }, + { + "entropy": 0.4195931971073151, + "epoch": 4.048280024140012, + "grad_norm": 0.6678048968315125, + "learning_rate": 0.0002710062354592273, + "loss": 0.3970795154571533, + "mean_token_accuracy": 0.8719995342195034, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.46495268753405367, + "eval_loss": 0.7061581611633301, + "eval_mean_token_accuracy": 0.8190107995204712, + "eval_num_tokens": 3890738.0, + "eval_runtime": 89.6387, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 1680 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.6830788507998003e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..fc6a9c8c7684b2886f6b5058f1d88e17175569d6 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1700/trainer_state.json @@ -0,0 +1,1819 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.096560048280024, + "eval_steps": 20, + "global_step": 1700, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + }, + { + "entropy": 0.5455610822886229, + "epoch": 3.712130356065178, + "grad_norm": 0.7269843220710754, + "learning_rate": 0.0002891155191539905, + "loss": 0.5407682895660401, + "mean_token_accuracy": 0.8393648222088814, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.6032205542151847, + "eval_loss": 0.6790974140167236, + "eval_mean_token_accuracy": 0.8165463112043531, + "eval_num_tokens": 3569036.0, + "eval_runtime": 89.517, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1540 + }, + { + "entropy": 0.5474163968116045, + "epoch": 3.7604103802051903, + "grad_norm": 0.8148866295814514, + "learning_rate": 0.00028661336281380717, + "loss": 0.5394441604614257, + "mean_token_accuracy": 0.8336028568446636, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5797032238392348, + "eval_loss": 0.670870304107666, + "eval_mean_token_accuracy": 0.8182691593518417, + "eval_num_tokens": 3614313.0, + "eval_runtime": 89.4468, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.99, + "step": 1560 + }, + { + "entropy": 0.5511750865727663, + "epoch": 3.808690404345202, + "grad_norm": 1.3441656827926636, + "learning_rate": 0.0002840817043244964, + "loss": 0.5378933906555176, + "mean_token_accuracy": 0.8349151819944381, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5297858750217417, + "eval_loss": 0.680833637714386, + "eval_mean_token_accuracy": 0.8180924275617921, + "eval_num_tokens": 3659786.0, + "eval_runtime": 89.5417, + "eval_samples_per_second": 15.859, + "eval_steps_per_second": 1.988, + "step": 1580 + }, + { + "entropy": 0.5379613988101483, + "epoch": 3.856970428485214, + "grad_norm": 0.9813932776451111, + "learning_rate": 0.00028152126011546396, + "loss": 0.5340342044830322, + "mean_token_accuracy": 0.8346010789275169, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5811898510777549, + "eval_loss": 0.6764267683029175, + "eval_mean_token_accuracy": 0.8180528236239144, + "eval_num_tokens": 3706362.0, + "eval_runtime": 88.7831, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 1600 + }, + { + "entropy": 0.5607876226305961, + "epoch": 3.9052504526252263, + "grad_norm": 0.9617928266525269, + "learning_rate": 0.00027893275476213383, + "loss": 0.5434338569641113, + "mean_token_accuracy": 0.8332898400723934, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5474644318390428, + "eval_loss": 0.6740226745605469, + "eval_mean_token_accuracy": 0.8185851306058047, + "eval_num_tokens": 3753013.0, + "eval_runtime": 89.3246, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.5354843523353339, + "epoch": 3.9535304767652386, + "grad_norm": 1.5320990085601807, + "learning_rate": 0.0002763169207809021, + "loss": 0.5251852989196777, + "mean_token_accuracy": 0.8416872084140777, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.5436856410141742, + "eval_loss": 0.6675190925598145, + "eval_mean_token_accuracy": 0.8202396507343549, + "eval_num_tokens": 3800024.0, + "eval_runtime": 89.6328, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.986, + "step": 1640 + }, + { + "entropy": 0.5418571938167919, + "epoch": 4.0, + "grad_norm": 4.690354347229004, + "learning_rate": 0.000273674498421843, + "loss": 0.548275089263916, + "mean_token_accuracy": 0.836557479647847, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5497228983747825, + "eval_loss": 0.6621812582015991, + "eval_mean_token_accuracy": 0.8205679802412398, + "eval_num_tokens": 3844304.0, + "eval_runtime": 89.6272, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.986, + "step": 1660 + }, + { + "entropy": 0.4195931971073151, + "epoch": 4.048280024140012, + "grad_norm": 0.6678048968315125, + "learning_rate": 0.0002710062354592273, + "loss": 0.3970795154571533, + "mean_token_accuracy": 0.8719995342195034, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.46495268753405367, + "eval_loss": 0.7061581611633301, + "eval_mean_token_accuracy": 0.8190107995204712, + "eval_num_tokens": 3890738.0, + "eval_runtime": 89.6387, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 1680 + }, + { + "entropy": 0.4263830740004778, + "epoch": 4.096560048280024, + "grad_norm": 0.7026669383049011, + "learning_rate": 0.000268312886979911, + "loss": 0.398905086517334, + "mean_token_accuracy": 0.8691012300550938, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.45755320670229666, + "eval_loss": 0.7102291584014893, + "eval_mean_token_accuracy": 0.819212955370378, + "eval_num_tokens": 3938205.0, + "eval_runtime": 89.2777, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.994, + "step": 1700 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7021515523994624e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0ff7bf87334d99140ff56806457cf9b57c4b81d2 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1720/trainer_state.json @@ -0,0 +1,1840 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.1448400724200365, + "eval_steps": 20, + "global_step": 1720, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + }, + { + "entropy": 0.5455610822886229, + "epoch": 3.712130356065178, + "grad_norm": 0.7269843220710754, + "learning_rate": 0.0002891155191539905, + "loss": 0.5407682895660401, + "mean_token_accuracy": 0.8393648222088814, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.6032205542151847, + "eval_loss": 0.6790974140167236, + "eval_mean_token_accuracy": 0.8165463112043531, + "eval_num_tokens": 3569036.0, + "eval_runtime": 89.517, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1540 + }, + { + "entropy": 0.5474163968116045, + "epoch": 3.7604103802051903, + "grad_norm": 0.8148866295814514, + "learning_rate": 0.00028661336281380717, + "loss": 0.5394441604614257, + "mean_token_accuracy": 0.8336028568446636, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5797032238392348, + "eval_loss": 0.670870304107666, + "eval_mean_token_accuracy": 0.8182691593518417, + "eval_num_tokens": 3614313.0, + "eval_runtime": 89.4468, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.99, + "step": 1560 + }, + { + "entropy": 0.5511750865727663, + "epoch": 3.808690404345202, + "grad_norm": 1.3441656827926636, + "learning_rate": 0.0002840817043244964, + "loss": 0.5378933906555176, + "mean_token_accuracy": 0.8349151819944381, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5297858750217417, + "eval_loss": 0.680833637714386, + "eval_mean_token_accuracy": 0.8180924275617921, + "eval_num_tokens": 3659786.0, + "eval_runtime": 89.5417, + "eval_samples_per_second": 15.859, + "eval_steps_per_second": 1.988, + "step": 1580 + }, + { + "entropy": 0.5379613988101483, + "epoch": 3.856970428485214, + "grad_norm": 0.9813932776451111, + "learning_rate": 0.00028152126011546396, + "loss": 0.5340342044830322, + "mean_token_accuracy": 0.8346010789275169, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5811898510777549, + "eval_loss": 0.6764267683029175, + "eval_mean_token_accuracy": 0.8180528236239144, + "eval_num_tokens": 3706362.0, + "eval_runtime": 88.7831, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 1600 + }, + { + "entropy": 0.5607876226305961, + "epoch": 3.9052504526252263, + "grad_norm": 0.9617928266525269, + "learning_rate": 0.00027893275476213383, + "loss": 0.5434338569641113, + "mean_token_accuracy": 0.8332898400723934, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5474644318390428, + "eval_loss": 0.6740226745605469, + "eval_mean_token_accuracy": 0.8185851306058047, + "eval_num_tokens": 3753013.0, + "eval_runtime": 89.3246, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.5354843523353339, + "epoch": 3.9535304767652386, + "grad_norm": 1.5320990085601807, + "learning_rate": 0.0002763169207809021, + "loss": 0.5251852989196777, + "mean_token_accuracy": 0.8416872084140777, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.5436856410141742, + "eval_loss": 0.6675190925598145, + "eval_mean_token_accuracy": 0.8202396507343549, + "eval_num_tokens": 3800024.0, + "eval_runtime": 89.6328, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.986, + "step": 1640 + }, + { + "entropy": 0.5418571938167919, + "epoch": 4.0, + "grad_norm": 4.690354347229004, + "learning_rate": 0.000273674498421843, + "loss": 0.548275089263916, + "mean_token_accuracy": 0.836557479647847, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5497228983747825, + "eval_loss": 0.6621812582015991, + "eval_mean_token_accuracy": 0.8205679802412398, + "eval_num_tokens": 3844304.0, + "eval_runtime": 89.6272, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.986, + "step": 1660 + }, + { + "entropy": 0.4195931971073151, + "epoch": 4.048280024140012, + "grad_norm": 0.6678048968315125, + "learning_rate": 0.0002710062354592273, + "loss": 0.3970795154571533, + "mean_token_accuracy": 0.8719995342195034, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.46495268753405367, + "eval_loss": 0.7061581611633301, + "eval_mean_token_accuracy": 0.8190107995204712, + "eval_num_tokens": 3890738.0, + "eval_runtime": 89.6387, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 1680 + }, + { + "entropy": 0.4263830740004778, + "epoch": 4.096560048280024, + "grad_norm": 0.7026669383049011, + "learning_rate": 0.000268312886979911, + "loss": 0.398905086517334, + "mean_token_accuracy": 0.8691012300550938, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.45755320670229666, + "eval_loss": 0.7102291584014893, + "eval_mean_token_accuracy": 0.819212955370378, + "eval_num_tokens": 3938205.0, + "eval_runtime": 89.2777, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.994, + "step": 1700 + }, + { + "entropy": 0.41640330031514167, + "epoch": 4.1448400724200365, + "grad_norm": 0.752216100692749, + "learning_rate": 0.00026559521516965437, + "loss": 0.39748263359069824, + "mean_token_accuracy": 0.8684553548693656, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.469178682297803, + "eval_loss": 0.7004125714302063, + "eval_mean_token_accuracy": 0.8194386949030201, + "eval_num_tokens": 3986350.0, + "eval_runtime": 89.8428, + "eval_samples_per_second": 15.805, + "eval_steps_per_second": 1.981, + "step": 1720 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7232312454235136e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5826899c7584526b8913fb08fb5f8543f662ccfc --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1740/trainer_state.json @@ -0,0 +1,1861 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.193120096560048, + "eval_steps": 20, + "global_step": 1740, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + }, + { + "entropy": 0.5455610822886229, + "epoch": 3.712130356065178, + "grad_norm": 0.7269843220710754, + "learning_rate": 0.0002891155191539905, + "loss": 0.5407682895660401, + "mean_token_accuracy": 0.8393648222088814, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.6032205542151847, + "eval_loss": 0.6790974140167236, + "eval_mean_token_accuracy": 0.8165463112043531, + "eval_num_tokens": 3569036.0, + "eval_runtime": 89.517, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1540 + }, + { + "entropy": 0.5474163968116045, + "epoch": 3.7604103802051903, + "grad_norm": 0.8148866295814514, + "learning_rate": 0.00028661336281380717, + "loss": 0.5394441604614257, + "mean_token_accuracy": 0.8336028568446636, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5797032238392348, + "eval_loss": 0.670870304107666, + "eval_mean_token_accuracy": 0.8182691593518417, + "eval_num_tokens": 3614313.0, + "eval_runtime": 89.4468, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.99, + "step": 1560 + }, + { + "entropy": 0.5511750865727663, + "epoch": 3.808690404345202, + "grad_norm": 1.3441656827926636, + "learning_rate": 0.0002840817043244964, + "loss": 0.5378933906555176, + "mean_token_accuracy": 0.8349151819944381, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5297858750217417, + "eval_loss": 0.680833637714386, + "eval_mean_token_accuracy": 0.8180924275617921, + "eval_num_tokens": 3659786.0, + "eval_runtime": 89.5417, + "eval_samples_per_second": 15.859, + "eval_steps_per_second": 1.988, + "step": 1580 + }, + { + "entropy": 0.5379613988101483, + "epoch": 3.856970428485214, + "grad_norm": 0.9813932776451111, + "learning_rate": 0.00028152126011546396, + "loss": 0.5340342044830322, + "mean_token_accuracy": 0.8346010789275169, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5811898510777549, + "eval_loss": 0.6764267683029175, + "eval_mean_token_accuracy": 0.8180528236239144, + "eval_num_tokens": 3706362.0, + "eval_runtime": 88.7831, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 1600 + }, + { + "entropy": 0.5607876226305961, + "epoch": 3.9052504526252263, + "grad_norm": 0.9617928266525269, + "learning_rate": 0.00027893275476213383, + "loss": 0.5434338569641113, + "mean_token_accuracy": 0.8332898400723934, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5474644318390428, + "eval_loss": 0.6740226745605469, + "eval_mean_token_accuracy": 0.8185851306058047, + "eval_num_tokens": 3753013.0, + "eval_runtime": 89.3246, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.5354843523353339, + "epoch": 3.9535304767652386, + "grad_norm": 1.5320990085601807, + "learning_rate": 0.0002763169207809021, + "loss": 0.5251852989196777, + "mean_token_accuracy": 0.8416872084140777, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.5436856410141742, + "eval_loss": 0.6675190925598145, + "eval_mean_token_accuracy": 0.8202396507343549, + "eval_num_tokens": 3800024.0, + "eval_runtime": 89.6328, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.986, + "step": 1640 + }, + { + "entropy": 0.5418571938167919, + "epoch": 4.0, + "grad_norm": 4.690354347229004, + "learning_rate": 0.000273674498421843, + "loss": 0.548275089263916, + "mean_token_accuracy": 0.836557479647847, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5497228983747825, + "eval_loss": 0.6621812582015991, + "eval_mean_token_accuracy": 0.8205679802412398, + "eval_num_tokens": 3844304.0, + "eval_runtime": 89.6272, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.986, + "step": 1660 + }, + { + "entropy": 0.4195931971073151, + "epoch": 4.048280024140012, + "grad_norm": 0.6678048968315125, + "learning_rate": 0.0002710062354592273, + "loss": 0.3970795154571533, + "mean_token_accuracy": 0.8719995342195034, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.46495268753405367, + "eval_loss": 0.7061581611633301, + "eval_mean_token_accuracy": 0.8190107995204712, + "eval_num_tokens": 3890738.0, + "eval_runtime": 89.6387, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 1680 + }, + { + "entropy": 0.4263830740004778, + "epoch": 4.096560048280024, + "grad_norm": 0.7026669383049011, + "learning_rate": 0.000268312886979911, + "loss": 0.398905086517334, + "mean_token_accuracy": 0.8691012300550938, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.45755320670229666, + "eval_loss": 0.7102291584014893, + "eval_mean_token_accuracy": 0.819212955370378, + "eval_num_tokens": 3938205.0, + "eval_runtime": 89.2777, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.994, + "step": 1700 + }, + { + "entropy": 0.41640330031514167, + "epoch": 4.1448400724200365, + "grad_norm": 0.752216100692749, + "learning_rate": 0.00026559521516965437, + "loss": 0.39748263359069824, + "mean_token_accuracy": 0.8684553548693656, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.469178682297803, + "eval_loss": 0.7004125714302063, + "eval_mean_token_accuracy": 0.8194386949030201, + "eval_num_tokens": 3986350.0, + "eval_runtime": 89.8428, + "eval_samples_per_second": 15.805, + "eval_steps_per_second": 1.981, + "step": 1720 + }, + { + "entropy": 0.42079071439802646, + "epoch": 4.193120096560048, + "grad_norm": 0.8349477648735046, + "learning_rate": 0.0002628539890974329, + "loss": 0.40129623413085935, + "mean_token_accuracy": 0.8686790131032467, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48358210871058904, + "eval_loss": 0.70196533203125, + "eval_mean_token_accuracy": 0.818096743875675, + "eval_num_tokens": 4033541.0, + "eval_runtime": 90.444, + "eval_samples_per_second": 15.7, + "eval_steps_per_second": 1.968, + "step": 1740 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7427670988903424e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5fc7697618ec4d88bdaad248c9b2778e9253e34f --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1760/trainer_state.json @@ -0,0 +1,1882 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.24140012070006, + "eval_steps": 20, + "global_step": 1760, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + }, + { + "entropy": 0.5455610822886229, + "epoch": 3.712130356065178, + "grad_norm": 0.7269843220710754, + "learning_rate": 0.0002891155191539905, + "loss": 0.5407682895660401, + "mean_token_accuracy": 0.8393648222088814, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.6032205542151847, + "eval_loss": 0.6790974140167236, + "eval_mean_token_accuracy": 0.8165463112043531, + "eval_num_tokens": 3569036.0, + "eval_runtime": 89.517, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1540 + }, + { + "entropy": 0.5474163968116045, + "epoch": 3.7604103802051903, + "grad_norm": 0.8148866295814514, + "learning_rate": 0.00028661336281380717, + "loss": 0.5394441604614257, + "mean_token_accuracy": 0.8336028568446636, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5797032238392348, + "eval_loss": 0.670870304107666, + "eval_mean_token_accuracy": 0.8182691593518417, + "eval_num_tokens": 3614313.0, + "eval_runtime": 89.4468, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.99, + "step": 1560 + }, + { + "entropy": 0.5511750865727663, + "epoch": 3.808690404345202, + "grad_norm": 1.3441656827926636, + "learning_rate": 0.0002840817043244964, + "loss": 0.5378933906555176, + "mean_token_accuracy": 0.8349151819944381, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5297858750217417, + "eval_loss": 0.680833637714386, + "eval_mean_token_accuracy": 0.8180924275617921, + "eval_num_tokens": 3659786.0, + "eval_runtime": 89.5417, + "eval_samples_per_second": 15.859, + "eval_steps_per_second": 1.988, + "step": 1580 + }, + { + "entropy": 0.5379613988101483, + "epoch": 3.856970428485214, + "grad_norm": 0.9813932776451111, + "learning_rate": 0.00028152126011546396, + "loss": 0.5340342044830322, + "mean_token_accuracy": 0.8346010789275169, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5811898510777549, + "eval_loss": 0.6764267683029175, + "eval_mean_token_accuracy": 0.8180528236239144, + "eval_num_tokens": 3706362.0, + "eval_runtime": 88.7831, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 1600 + }, + { + "entropy": 0.5607876226305961, + "epoch": 3.9052504526252263, + "grad_norm": 0.9617928266525269, + "learning_rate": 0.00027893275476213383, + "loss": 0.5434338569641113, + "mean_token_accuracy": 0.8332898400723934, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5474644318390428, + "eval_loss": 0.6740226745605469, + "eval_mean_token_accuracy": 0.8185851306058047, + "eval_num_tokens": 3753013.0, + "eval_runtime": 89.3246, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.5354843523353339, + "epoch": 3.9535304767652386, + "grad_norm": 1.5320990085601807, + "learning_rate": 0.0002763169207809021, + "loss": 0.5251852989196777, + "mean_token_accuracy": 0.8416872084140777, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.5436856410141742, + "eval_loss": 0.6675190925598145, + "eval_mean_token_accuracy": 0.8202396507343549, + "eval_num_tokens": 3800024.0, + "eval_runtime": 89.6328, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.986, + "step": 1640 + }, + { + "entropy": 0.5418571938167919, + "epoch": 4.0, + "grad_norm": 4.690354347229004, + "learning_rate": 0.000273674498421843, + "loss": 0.548275089263916, + "mean_token_accuracy": 0.836557479647847, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5497228983747825, + "eval_loss": 0.6621812582015991, + "eval_mean_token_accuracy": 0.8205679802412398, + "eval_num_tokens": 3844304.0, + "eval_runtime": 89.6272, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.986, + "step": 1660 + }, + { + "entropy": 0.4195931971073151, + "epoch": 4.048280024140012, + "grad_norm": 0.6678048968315125, + "learning_rate": 0.0002710062354592273, + "loss": 0.3970795154571533, + "mean_token_accuracy": 0.8719995342195034, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.46495268753405367, + "eval_loss": 0.7061581611633301, + "eval_mean_token_accuracy": 0.8190107995204712, + "eval_num_tokens": 3890738.0, + "eval_runtime": 89.6387, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 1680 + }, + { + "entropy": 0.4263830740004778, + "epoch": 4.096560048280024, + "grad_norm": 0.7026669383049011, + "learning_rate": 0.000268312886979911, + "loss": 0.398905086517334, + "mean_token_accuracy": 0.8691012300550938, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.45755320670229666, + "eval_loss": 0.7102291584014893, + "eval_mean_token_accuracy": 0.819212955370378, + "eval_num_tokens": 3938205.0, + "eval_runtime": 89.2777, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.994, + "step": 1700 + }, + { + "entropy": 0.41640330031514167, + "epoch": 4.1448400724200365, + "grad_norm": 0.752216100692749, + "learning_rate": 0.00026559521516965437, + "loss": 0.39748263359069824, + "mean_token_accuracy": 0.8684553548693656, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.469178682297803, + "eval_loss": 0.7004125714302063, + "eval_mean_token_accuracy": 0.8194386949030201, + "eval_num_tokens": 3986350.0, + "eval_runtime": 89.8428, + "eval_samples_per_second": 15.805, + "eval_steps_per_second": 1.981, + "step": 1720 + }, + { + "entropy": 0.42079071439802646, + "epoch": 4.193120096560048, + "grad_norm": 0.8349477648735046, + "learning_rate": 0.0002628539890974329, + "loss": 0.40129623413085935, + "mean_token_accuracy": 0.8686790131032467, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48358210871058904, + "eval_loss": 0.70196533203125, + "eval_mean_token_accuracy": 0.818096743875675, + "eval_num_tokens": 4033541.0, + "eval_runtime": 90.444, + "eval_samples_per_second": 15.7, + "eval_steps_per_second": 1.968, + "step": 1740 + }, + { + "entropy": 0.4285690750926733, + "epoch": 4.24140012070006, + "grad_norm": 0.781974732875824, + "learning_rate": 0.00026008998449779933, + "loss": 0.40457854270935056, + "mean_token_accuracy": 0.8679066866636276, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.4653420230645812, + "eval_loss": 0.7041526436805725, + "eval_mean_token_accuracy": 0.8190121017815022, + "eval_num_tokens": 4079253.0, + "eval_runtime": 89.5248, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.988, + "step": 1760 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.762383734659584e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e38fe58ce735f34392ef88999f08a9043898ee91 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1780/trainer_state.json @@ -0,0 +1,1903 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.289680144840072, + "eval_steps": 20, + "global_step": 1780, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + }, + { + "entropy": 0.5455610822886229, + "epoch": 3.712130356065178, + "grad_norm": 0.7269843220710754, + "learning_rate": 0.0002891155191539905, + "loss": 0.5407682895660401, + "mean_token_accuracy": 0.8393648222088814, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.6032205542151847, + "eval_loss": 0.6790974140167236, + "eval_mean_token_accuracy": 0.8165463112043531, + "eval_num_tokens": 3569036.0, + "eval_runtime": 89.517, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1540 + }, + { + "entropy": 0.5474163968116045, + "epoch": 3.7604103802051903, + "grad_norm": 0.8148866295814514, + "learning_rate": 0.00028661336281380717, + "loss": 0.5394441604614257, + "mean_token_accuracy": 0.8336028568446636, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5797032238392348, + "eval_loss": 0.670870304107666, + "eval_mean_token_accuracy": 0.8182691593518417, + "eval_num_tokens": 3614313.0, + "eval_runtime": 89.4468, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.99, + "step": 1560 + }, + { + "entropy": 0.5511750865727663, + "epoch": 3.808690404345202, + "grad_norm": 1.3441656827926636, + "learning_rate": 0.0002840817043244964, + "loss": 0.5378933906555176, + "mean_token_accuracy": 0.8349151819944381, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5297858750217417, + "eval_loss": 0.680833637714386, + "eval_mean_token_accuracy": 0.8180924275617921, + "eval_num_tokens": 3659786.0, + "eval_runtime": 89.5417, + "eval_samples_per_second": 15.859, + "eval_steps_per_second": 1.988, + "step": 1580 + }, + { + "entropy": 0.5379613988101483, + "epoch": 3.856970428485214, + "grad_norm": 0.9813932776451111, + "learning_rate": 0.00028152126011546396, + "loss": 0.5340342044830322, + "mean_token_accuracy": 0.8346010789275169, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5811898510777549, + "eval_loss": 0.6764267683029175, + "eval_mean_token_accuracy": 0.8180528236239144, + "eval_num_tokens": 3706362.0, + "eval_runtime": 88.7831, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 1600 + }, + { + "entropy": 0.5607876226305961, + "epoch": 3.9052504526252263, + "grad_norm": 0.9617928266525269, + "learning_rate": 0.00027893275476213383, + "loss": 0.5434338569641113, + "mean_token_accuracy": 0.8332898400723934, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5474644318390428, + "eval_loss": 0.6740226745605469, + "eval_mean_token_accuracy": 0.8185851306058047, + "eval_num_tokens": 3753013.0, + "eval_runtime": 89.3246, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.5354843523353339, + "epoch": 3.9535304767652386, + "grad_norm": 1.5320990085601807, + "learning_rate": 0.0002763169207809021, + "loss": 0.5251852989196777, + "mean_token_accuracy": 0.8416872084140777, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.5436856410141742, + "eval_loss": 0.6675190925598145, + "eval_mean_token_accuracy": 0.8202396507343549, + "eval_num_tokens": 3800024.0, + "eval_runtime": 89.6328, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.986, + "step": 1640 + }, + { + "entropy": 0.5418571938167919, + "epoch": 4.0, + "grad_norm": 4.690354347229004, + "learning_rate": 0.000273674498421843, + "loss": 0.548275089263916, + "mean_token_accuracy": 0.836557479647847, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5497228983747825, + "eval_loss": 0.6621812582015991, + "eval_mean_token_accuracy": 0.8205679802412398, + "eval_num_tokens": 3844304.0, + "eval_runtime": 89.6272, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.986, + "step": 1660 + }, + { + "entropy": 0.4195931971073151, + "epoch": 4.048280024140012, + "grad_norm": 0.6678048968315125, + "learning_rate": 0.0002710062354592273, + "loss": 0.3970795154571533, + "mean_token_accuracy": 0.8719995342195034, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.46495268753405367, + "eval_loss": 0.7061581611633301, + "eval_mean_token_accuracy": 0.8190107995204712, + "eval_num_tokens": 3890738.0, + "eval_runtime": 89.6387, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 1680 + }, + { + "entropy": 0.4263830740004778, + "epoch": 4.096560048280024, + "grad_norm": 0.7026669383049011, + "learning_rate": 0.000268312886979911, + "loss": 0.398905086517334, + "mean_token_accuracy": 0.8691012300550938, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.45755320670229666, + "eval_loss": 0.7102291584014893, + "eval_mean_token_accuracy": 0.819212955370378, + "eval_num_tokens": 3938205.0, + "eval_runtime": 89.2777, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.994, + "step": 1700 + }, + { + "entropy": 0.41640330031514167, + "epoch": 4.1448400724200365, + "grad_norm": 0.752216100692749, + "learning_rate": 0.00026559521516965437, + "loss": 0.39748263359069824, + "mean_token_accuracy": 0.8684553548693656, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.469178682297803, + "eval_loss": 0.7004125714302063, + "eval_mean_token_accuracy": 0.8194386949030201, + "eval_num_tokens": 3986350.0, + "eval_runtime": 89.8428, + "eval_samples_per_second": 15.805, + "eval_steps_per_second": 1.981, + "step": 1720 + }, + { + "entropy": 0.42079071439802646, + "epoch": 4.193120096560048, + "grad_norm": 0.8349477648735046, + "learning_rate": 0.0002628539890974329, + "loss": 0.40129623413085935, + "mean_token_accuracy": 0.8686790131032467, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48358210871058904, + "eval_loss": 0.70196533203125, + "eval_mean_token_accuracy": 0.818096743875675, + "eval_num_tokens": 4033541.0, + "eval_runtime": 90.444, + "eval_samples_per_second": 15.7, + "eval_steps_per_second": 1.968, + "step": 1740 + }, + { + "entropy": 0.4285690750926733, + "epoch": 4.24140012070006, + "grad_norm": 0.781974732875824, + "learning_rate": 0.00026008998449779933, + "loss": 0.40457854270935056, + "mean_token_accuracy": 0.8679066866636276, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.4653420230645812, + "eval_loss": 0.7041526436805725, + "eval_mean_token_accuracy": 0.8190121017815022, + "eval_num_tokens": 4079253.0, + "eval_runtime": 89.5248, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.988, + "step": 1760 + }, + { + "entropy": 0.4335357129573822, + "epoch": 4.289680144840072, + "grad_norm": 0.8383703827857971, + "learning_rate": 0.0002573039835513604, + "loss": 0.41876921653747556, + "mean_token_accuracy": 0.8663770146667957, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.5015502416350869, + "eval_loss": 0.6904259324073792, + "eval_mean_token_accuracy": 0.8200626497188311, + "eval_num_tokens": 4125495.0, + "eval_runtime": 89.7014, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.984, + "step": 1780 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7824312093750272e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..682e10525879325be7ac4fbf6d19b21dbab6235f --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-180/trainer_state.json @@ -0,0 +1,223 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.43452021726010864, + "eval_steps": 20, + "global_step": 180, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.842464801808384e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce4b072fcbe5b636867e13937c56fedee3b68b4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.02728394274790723, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4f3aa1833d1bf90351e208e3b574def2714cbdc5 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test1/checkpoint-1800/trainer_state.json @@ -0,0 +1,1924 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.337960168980085, + "eval_steps": 20, + "global_step": 1800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.024795526266098, + "epoch": 0.04828002414001207, + "grad_norm": 2.945375919342041, + "learning_rate": 1.6698127428345936e-05, + "loss": 1.7825420379638672, + "mean_token_accuracy": 0.6315708436071873, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.29921497588747, + "eval_loss": 1.169131875038147, + "eval_mean_token_accuracy": 0.7185706342204233, + "eval_num_tokens": 47778.0, + "eval_runtime": 91.7898, + "eval_samples_per_second": 15.47, + "eval_steps_per_second": 1.939, + "step": 20 + }, + { + "entropy": 1.0346344470977784, + "epoch": 0.09656004828002414, + "grad_norm": 1.7916979789733887, + "learning_rate": 3.427510366871008e-05, + "loss": 0.9480395317077637, + "mean_token_accuracy": 0.7543429024517536, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 0.9673695430326997, + "eval_loss": 0.8588430285453796, + "eval_mean_token_accuracy": 0.7737233002534073, + "eval_num_tokens": 95981.0, + "eval_runtime": 89.8219, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 40 + }, + { + "entropy": 0.8977566614747048, + "epoch": 0.14484007242003621, + "grad_norm": 1.7972187995910645, + "learning_rate": 5.185207990907422e-05, + "loss": 0.8029604911804199, + "mean_token_accuracy": 0.7818016350269318, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8436836982041263, + "eval_loss": 0.7893033623695374, + "eval_mean_token_accuracy": 0.7858914984076211, + "eval_num_tokens": 142784.0, + "eval_runtime": 89.9349, + "eval_samples_per_second": 15.789, + "eval_steps_per_second": 1.979, + "step": 60 + }, + { + "entropy": 0.8650321319699288, + "epoch": 0.19312009656004828, + "grad_norm": 1.2128729820251465, + "learning_rate": 6.942905614943836e-05, + "loss": 0.77417893409729, + "mean_token_accuracy": 0.7875479467213153, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8209857180547179, + "eval_loss": 0.7572280168533325, + "eval_mean_token_accuracy": 0.7925970383574453, + "eval_num_tokens": 187338.0, + "eval_runtime": 89.9459, + "eval_samples_per_second": 15.787, + "eval_steps_per_second": 1.979, + "step": 80 + }, + { + "entropy": 0.8096660938113928, + "epoch": 0.24140012070006034, + "grad_norm": 1.1254287958145142, + "learning_rate": 8.700603238980251e-05, + "loss": 0.7170331001281738, + "mean_token_accuracy": 0.7994555257260799, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.792780208788561, + "eval_loss": 0.7442984580993652, + "eval_mean_token_accuracy": 0.7954704573984896, + "eval_num_tokens": 236038.0, + "eval_runtime": 90.294, + "eval_samples_per_second": 15.726, + "eval_steps_per_second": 1.971, + "step": 100 + }, + { + "entropy": 0.7979829199612141, + "epoch": 0.28968014484007243, + "grad_norm": 1.2140507698059082, + "learning_rate": 0.00010458300863016666, + "loss": 0.7141861915588379, + "mean_token_accuracy": 0.8000014744699001, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.7938692486018277, + "eval_loss": 0.7279797196388245, + "eval_mean_token_accuracy": 0.7989798734027348, + "eval_num_tokens": 282918.0, + "eval_runtime": 89.7189, + "eval_samples_per_second": 15.827, + "eval_steps_per_second": 1.984, + "step": 120 + }, + { + "entropy": 0.7916347607970238, + "epoch": 0.33796016898008446, + "grad_norm": 1.0506458282470703, + "learning_rate": 0.0001221599848705308, + "loss": 0.7117055416107178, + "mean_token_accuracy": 0.7970046654343605, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.8052781063519167, + "eval_loss": 0.722576916217804, + "eval_mean_token_accuracy": 0.7982530523551984, + "eval_num_tokens": 331305.0, + "eval_runtime": 90.0376, + "eval_samples_per_second": 15.771, + "eval_steps_per_second": 1.977, + "step": 140 + }, + { + "entropy": 0.7880666613578796, + "epoch": 0.38624019312009655, + "grad_norm": 0.8409207463264465, + "learning_rate": 0.00013973696111089492, + "loss": 0.7052523136138916, + "mean_token_accuracy": 0.8000123649835587, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7787443134891853, + "eval_loss": 0.7137772440910339, + "eval_mean_token_accuracy": 0.8014209287220173, + "eval_num_tokens": 375876.0, + "eval_runtime": 90.2562, + "eval_samples_per_second": 15.733, + "eval_steps_per_second": 1.972, + "step": 160 + }, + { + "entropy": 0.7696007996797561, + "epoch": 0.43452021726010864, + "grad_norm": 1.0182477235794067, + "learning_rate": 0.00015731393735125907, + "loss": 0.7008797645568847, + "mean_token_accuracy": 0.8007259473204613, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.752259682068664, + "eval_loss": 0.7171286344528198, + "eval_mean_token_accuracy": 0.80052122574174, + "eval_num_tokens": 423913.0, + "eval_runtime": 90.0797, + "eval_samples_per_second": 15.764, + "eval_steps_per_second": 1.976, + "step": 180 + }, + { + "entropy": 0.7828126326203346, + "epoch": 0.4828002414001207, + "grad_norm": 0.9553632736206055, + "learning_rate": 0.0001748909135916232, + "loss": 0.7046853542327881, + "mean_token_accuracy": 0.7988562889397144, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7389638169427936, + "eval_loss": 0.7187935709953308, + "eval_mean_token_accuracy": 0.7995899999409579, + "eval_num_tokens": 472395.0, + "eval_runtime": 89.9223, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.979, + "step": 200 + }, + { + "entropy": 0.7909286297857762, + "epoch": 0.5310802655401328, + "grad_norm": 1.134459376335144, + "learning_rate": 0.00019246788983198735, + "loss": 0.6989312171936035, + "mean_token_accuracy": 0.7991565138101577, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7496965199374082, + "eval_loss": 0.7106321454048157, + "eval_mean_token_accuracy": 0.8046183442131857, + "eval_num_tokens": 517049.0, + "eval_runtime": 89.6899, + "eval_samples_per_second": 15.832, + "eval_steps_per_second": 1.985, + "step": 220 + }, + { + "entropy": 0.7651963323354721, + "epoch": 0.5793602896801449, + "grad_norm": 0.9557585716247559, + "learning_rate": 0.0002100448660723515, + "loss": 0.6984559059143066, + "mean_token_accuracy": 0.8019823372364044, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7615563079212488, + "eval_loss": 0.7098539471626282, + "eval_mean_token_accuracy": 0.8047233508544022, + "eval_num_tokens": 562836.0, + "eval_runtime": 90.3752, + "eval_samples_per_second": 15.712, + "eval_steps_per_second": 1.97, + "step": 240 + }, + { + "entropy": 0.787507726252079, + "epoch": 0.627640313820157, + "grad_norm": 0.9279311299324036, + "learning_rate": 0.00022762184231271568, + "loss": 0.708138370513916, + "mean_token_accuracy": 0.8013308703899383, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7856640896100676, + "eval_loss": 0.7191570401191711, + "eval_mean_token_accuracy": 0.8024677249153008, + "eval_num_tokens": 606612.0, + "eval_runtime": 93.7336, + "eval_samples_per_second": 15.149, + "eval_steps_per_second": 1.899, + "step": 260 + }, + { + "entropy": 0.768489234894514, + "epoch": 0.6759203379601689, + "grad_norm": 0.7992776036262512, + "learning_rate": 0.0002451988185530798, + "loss": 0.7035849571228028, + "mean_token_accuracy": 0.8031105332076549, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7682498740346244, + "eval_loss": 0.7149022221565247, + "eval_mean_token_accuracy": 0.7973497995499814, + "eval_num_tokens": 655920.0, + "eval_runtime": 89.7309, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 280 + }, + { + "entropy": 0.7720955617725849, + "epoch": 0.724200362100181, + "grad_norm": 1.1931514739990234, + "learning_rate": 0.0002627757947934439, + "loss": 0.6965402603149414, + "mean_token_accuracy": 0.8040348663926125, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7214708304807042, + "eval_loss": 0.7350823879241943, + "eval_mean_token_accuracy": 0.7942911925610532, + "eval_num_tokens": 702638.0, + "eval_runtime": 89.6451, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 300 + }, + { + "entropy": 0.7930095426738262, + "epoch": 0.7724803862401931, + "grad_norm": 0.8994467258453369, + "learning_rate": 0.0002803527710338081, + "loss": 0.7331492900848389, + "mean_token_accuracy": 0.796185302734375, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.8142535488926963, + "eval_loss": 0.7237834334373474, + "eval_mean_token_accuracy": 0.799495273761535, + "eval_num_tokens": 749377.0, + "eval_runtime": 90.6759, + "eval_samples_per_second": 15.66, + "eval_steps_per_second": 1.963, + "step": 320 + }, + { + "entropy": 0.7825102441012859, + "epoch": 0.8207604103802052, + "grad_norm": 1.8224239349365234, + "learning_rate": 0.00029792974727417223, + "loss": 0.7331175804138184, + "mean_token_accuracy": 0.7977667152881622, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7327135443017724, + "eval_loss": 0.7388784289360046, + "eval_mean_token_accuracy": 0.8007041252730938, + "eval_num_tokens": 798874.0, + "eval_runtime": 89.7692, + "eval_samples_per_second": 15.818, + "eval_steps_per_second": 1.983, + "step": 340 + }, + { + "entropy": 0.819331557303667, + "epoch": 0.8690404345202173, + "grad_norm": 1.0407779216766357, + "learning_rate": 0.0003155067235145364, + "loss": 0.7456695556640625, + "mean_token_accuracy": 0.7936980701982975, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.8065585420372781, + "eval_loss": 0.735519528388977, + "eval_mean_token_accuracy": 0.7974206296245704, + "eval_num_tokens": 840825.0, + "eval_runtime": 89.4336, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.99, + "step": 360 + }, + { + "entropy": 0.8114653021097183, + "epoch": 0.9173204586602294, + "grad_norm": 1.1209490299224854, + "learning_rate": 0.0003330836997549005, + "loss": 0.7340899467468261, + "mean_token_accuracy": 0.7914272703230381, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.8025527285056168, + "eval_loss": 0.7295576930046082, + "eval_mean_token_accuracy": 0.7990576628218876, + "eval_num_tokens": 882885.0, + "eval_runtime": 89.9579, + "eval_samples_per_second": 15.785, + "eval_steps_per_second": 1.979, + "step": 380 + }, + { + "entropy": 0.8042497783899307, + "epoch": 0.9656004828002414, + "grad_norm": 1.2437798976898193, + "learning_rate": 0.0003506606759952647, + "loss": 0.7381744384765625, + "mean_token_accuracy": 0.7967362694442273, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7717011336530193, + "eval_loss": 0.7436173558235168, + "eval_mean_token_accuracy": 0.7975849482450592, + "eval_num_tokens": 927456.0, + "eval_runtime": 89.8411, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 400 + }, + { + "entropy": 0.7987750010056929, + "epoch": 1.012070006035003, + "grad_norm": 1.2390918731689453, + "learning_rate": 0.000364721224843344, + "loss": 0.7317790031433106, + "mean_token_accuracy": 0.7986087551364651, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7333170604170038, + "eval_loss": 0.7456948757171631, + "eval_mean_token_accuracy": 0.7964897577682238, + "eval_num_tokens": 972662.0, + "eval_runtime": 89.7288, + "eval_samples_per_second": 15.825, + "eval_steps_per_second": 1.984, + "step": 420 + }, + { + "entropy": 0.7372976846992969, + "epoch": 1.060350030175015, + "grad_norm": 1.1552740335464478, + "learning_rate": 0.00036468510102269575, + "loss": 0.6734249114990234, + "mean_token_accuracy": 0.805834824591875, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.7130355526891987, + "eval_loss": 0.7555333375930786, + "eval_mean_token_accuracy": 0.7961652781186479, + "eval_num_tokens": 1022525.0, + "eval_runtime": 89.8713, + "eval_samples_per_second": 15.8, + "eval_steps_per_second": 1.981, + "step": 440 + }, + { + "entropy": 0.7465668715536594, + "epoch": 1.1086300543150271, + "grad_norm": 1.1991469860076904, + "learning_rate": 0.0003645973816745066, + "loss": 0.6871879577636719, + "mean_token_accuracy": 0.8042450234293937, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7772979542110743, + "eval_loss": 0.7561826705932617, + "eval_mean_token_accuracy": 0.7953876427720102, + "eval_num_tokens": 1069194.0, + "eval_runtime": 89.8395, + "eval_samples_per_second": 15.806, + "eval_steps_per_second": 1.981, + "step": 460 + }, + { + "entropy": 0.7477855801582336, + "epoch": 1.1569100784550392, + "grad_norm": 1.325486660003662, + "learning_rate": 0.00036445809162231435, + "loss": 0.6836830139160156, + "mean_token_accuracy": 0.8021619468927383, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.7098110676481483, + "eval_loss": 0.758007287979126, + "eval_mean_token_accuracy": 0.7909953189030122, + "eval_num_tokens": 1117570.0, + "eval_runtime": 89.6101, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.986, + "step": 480 + }, + { + "entropy": 0.7632691070437432, + "epoch": 1.2051901025950513, + "grad_norm": 1.0122262239456177, + "learning_rate": 0.0003642672702835562, + "loss": 0.7071213245391845, + "mean_token_accuracy": 0.8000680930912495, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7645382720432924, + "eval_loss": 0.7492606043815613, + "eval_mean_token_accuracy": 0.7976858676149604, + "eval_num_tokens": 1161717.0, + "eval_runtime": 89.6092, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.986, + "step": 500 + }, + { + "entropy": 0.7623726457357407, + "epoch": 1.2534701267350634, + "grad_norm": 1.367774486541748, + "learning_rate": 0.00036402497165841384, + "loss": 0.6965175151824952, + "mean_token_accuracy": 0.8016501650214195, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7868083715438843, + "eval_loss": 0.7481449842453003, + "eval_mean_token_accuracy": 0.799330582779445, + "eval_num_tokens": 1209390.0, + "eval_runtime": 89.8241, + "eval_samples_per_second": 15.809, + "eval_steps_per_second": 1.982, + "step": 520 + }, + { + "entropy": 0.7535207405686378, + "epoch": 1.3017501508750755, + "grad_norm": 1.213614821434021, + "learning_rate": 0.00036373126431453207, + "loss": 0.7078310489654541, + "mean_token_accuracy": 0.7998907208442688, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7829091950748743, + "eval_loss": 0.7416072487831116, + "eval_mean_token_accuracy": 0.7969146250339036, + "eval_num_tokens": 1256611.0, + "eval_runtime": 89.4607, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 540 + }, + { + "entropy": 0.7527363449335098, + "epoch": 1.3500301750150876, + "grad_norm": 1.0929982662200928, + "learning_rate": 0.00036338623136761495, + "loss": 0.7058369636535644, + "mean_token_accuracy": 0.7997087433934211, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.728419938114252, + "eval_loss": 0.744873046875, + "eval_mean_token_accuracy": 0.7966634296299366, + "eval_num_tokens": 1302325.0, + "eval_runtime": 89.6597, + "eval_samples_per_second": 15.838, + "eval_steps_per_second": 1.985, + "step": 560 + }, + { + "entropy": 0.7406099259853363, + "epoch": 1.3983101991550995, + "grad_norm": 1.409364104270935, + "learning_rate": 0.00036298997045790515, + "loss": 0.6902852058410645, + "mean_token_accuracy": 0.805386807769537, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.6991632758231645, + "eval_loss": 0.7480319738388062, + "eval_mean_token_accuracy": 0.7970068006033308, + "eval_num_tokens": 1343844.0, + "eval_runtime": 89.8329, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 580 + }, + { + "entropy": 0.7459449704736472, + "epoch": 1.4465902232951118, + "grad_norm": 1.7053111791610718, + "learning_rate": 0.00036254259372255277, + "loss": 0.7044640064239502, + "mean_token_accuracy": 0.8005018755793571, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7454566660891758, + "eval_loss": 0.7551484704017639, + "eval_mean_token_accuracy": 0.7897093731365846, + "eval_num_tokens": 1389471.0, + "eval_runtime": 89.8313, + "eval_samples_per_second": 15.807, + "eval_steps_per_second": 1.981, + "step": 600 + }, + { + "entropy": 0.7621391348540782, + "epoch": 1.4948702474351236, + "grad_norm": 1.174443244934082, + "learning_rate": 0.000362044227763882, + "loss": 0.7111573696136475, + "mean_token_accuracy": 0.798752411454916, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7664387949397055, + "eval_loss": 0.7365804314613342, + "eval_mean_token_accuracy": 0.7963101200843126, + "eval_num_tokens": 1435975.0, + "eval_runtime": 89.9623, + "eval_samples_per_second": 15.784, + "eval_steps_per_second": 1.979, + "step": 620 + }, + { + "entropy": 0.7424944408237935, + "epoch": 1.5431502715751357, + "grad_norm": 1.2898184061050415, + "learning_rate": 0.000361495013613564, + "loss": 0.6913110733032226, + "mean_token_accuracy": 0.8009015507996082, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7255479529332579, + "eval_loss": 0.7345991730690002, + "eval_mean_token_accuracy": 0.8013592945056015, + "eval_num_tokens": 1482035.0, + "eval_runtime": 89.817, + "eval_samples_per_second": 15.81, + "eval_steps_per_second": 1.982, + "step": 640 + }, + { + "entropy": 0.7303367637097835, + "epoch": 1.5914302957151478, + "grad_norm": 1.1310476064682007, + "learning_rate": 0.00036089510669270666, + "loss": 0.6875617027282714, + "mean_token_accuracy": 0.8035397171974182, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7101308248016271, + "eval_loss": 0.7394917011260986, + "eval_mean_token_accuracy": 0.7990792942850777, + "eval_num_tokens": 1528119.0, + "eval_runtime": 89.7431, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.983, + "step": 660 + }, + { + "entropy": 0.7387678384780884, + "epoch": 1.63971031985516, + "grad_norm": 0.9645389914512634, + "learning_rate": 0.0003602446767678725, + "loss": 0.6911204338073731, + "mean_token_accuracy": 0.8056333385407924, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7281073737010527, + "eval_loss": 0.7376708984375, + "eval_mean_token_accuracy": 0.7997356415464637, + "eval_num_tokens": 1573661.0, + "eval_runtime": 90.0338, + "eval_samples_per_second": 15.772, + "eval_steps_per_second": 1.977, + "step": 680 + }, + { + "entropy": 0.7449554048478604, + "epoch": 1.687990343995172, + "grad_norm": 1.9069629907608032, + "learning_rate": 0.0003595439079030364, + "loss": 0.7042286396026611, + "mean_token_accuracy": 0.8018639378249646, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7022633817088738, + "eval_loss": 0.7320939898490906, + "eval_mean_token_accuracy": 0.8006051541044471, + "eval_num_tokens": 1621714.0, + "eval_runtime": 89.8948, + "eval_samples_per_second": 15.796, + "eval_steps_per_second": 1.98, + "step": 700 + }, + { + "entropy": 0.723249051719904, + "epoch": 1.736270368135184, + "grad_norm": 0.8333877325057983, + "learning_rate": 0.00035879299840749777, + "loss": 0.7043714046478271, + "mean_token_accuracy": 0.8028345607221127, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.672436946898364, + "eval_loss": 0.713233470916748, + "eval_mean_token_accuracy": 0.8047760577684038, + "eval_num_tokens": 1672118.0, + "eval_runtime": 89.6394, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 720 + }, + { + "entropy": 0.730014206469059, + "epoch": 1.7845503922751962, + "grad_norm": 1.4580037593841553, + "learning_rate": 0.00035799216077976137, + "loss": 0.6985176563262939, + "mean_token_accuracy": 0.8015547141432762, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.6908873795123582, + "eval_loss": 0.7198202013969421, + "eval_mean_token_accuracy": 0.8024131682481659, + "eval_num_tokens": 1720465.0, + "eval_runtime": 89.3771, + "eval_samples_per_second": 15.888, + "eval_steps_per_second": 1.992, + "step": 740 + }, + { + "entropy": 0.7219605796039105, + "epoch": 1.832830416415208, + "grad_norm": 1.51682710647583, + "learning_rate": 0.000357141621647403, + "loss": 0.6844424724578857, + "mean_token_accuracy": 0.8032813094556331, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7113401109582922, + "eval_loss": 0.7195309400558472, + "eval_mean_token_accuracy": 0.8019187035185568, + "eval_num_tokens": 1764440.0, + "eval_runtime": 89.4658, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.729826743900776, + "epoch": 1.8811104405552204, + "grad_norm": 1.0838000774383545, + "learning_rate": 0.0003562416217029361, + "loss": 0.685858678817749, + "mean_token_accuracy": 0.8050567395985126, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.649370267484965, + "eval_loss": 0.7177029252052307, + "eval_mean_token_accuracy": 0.8050174043419656, + "eval_num_tokens": 1810828.0, + "eval_runtime": 89.2287, + "eval_samples_per_second": 15.914, + "eval_steps_per_second": 1.995, + "step": 780 + }, + { + "entropy": 0.6799364153295755, + "epoch": 1.9293904646952322, + "grad_norm": 1.1364924907684326, + "learning_rate": 0.00035529241563569903, + "loss": 0.6714428901672364, + "mean_token_accuracy": 0.8087341658771038, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6603799047095052, + "eval_loss": 0.7201809287071228, + "eval_mean_token_accuracy": 0.802863868769635, + "eval_num_tokens": 1857600.0, + "eval_runtime": 89.2718, + "eval_samples_per_second": 15.906, + "eval_steps_per_second": 1.994, + "step": 800 + }, + { + "entropy": 0.7078610375523567, + "epoch": 1.9776704888352445, + "grad_norm": 1.2191942930221558, + "learning_rate": 0.0003542942720597808, + "loss": 0.6996590614318847, + "mean_token_accuracy": 0.8049512051045895, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.7240545264120852, + "eval_loss": 0.7301309108734131, + "eval_mean_token_accuracy": 0.8015973166133581, + "eval_num_tokens": 1901998.0, + "eval_runtime": 89.3438, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.992, + "step": 820 + }, + { + "entropy": 0.6557391556826505, + "epoch": 2.024140012070006, + "grad_norm": 1.36203134059906, + "learning_rate": 0.0003532474734380064, + "loss": 0.6327113628387451, + "mean_token_accuracy": 0.8142829847026181, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6573808648613062, + "eval_loss": 0.7334365844726562, + "eval_mean_token_accuracy": 0.8043633893634496, + "eval_num_tokens": 1947553.0, + "eval_runtime": 89.3359, + "eval_samples_per_second": 15.895, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.6409128502011299, + "epoch": 2.0724200362100182, + "grad_norm": 1.5804955959320068, + "learning_rate": 0.0003521523160020035, + "loss": 0.6023559093475341, + "mean_token_accuracy": 0.8222251623868942, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6983234788594621, + "eval_loss": 0.7232135534286499, + "eval_mean_token_accuracy": 0.8010654268639811, + "eval_num_tokens": 1995234.0, + "eval_runtime": 89.2615, + "eval_samples_per_second": 15.908, + "eval_steps_per_second": 1.994, + "step": 860 + }, + { + "entropy": 0.6151149723678827, + "epoch": 2.12070006035003, + "grad_norm": 1.1975436210632324, + "learning_rate": 0.00035100910966837193, + "loss": 0.5803564548492431, + "mean_token_accuracy": 0.8256325736641884, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6636555573243773, + "eval_loss": 0.7205662727355957, + "eval_mean_token_accuracy": 0.8036768369460374, + "eval_num_tokens": 2040639.0, + "eval_runtime": 89.2957, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.993, + "step": 880 + }, + { + "entropy": 0.6201727617532015, + "epoch": 2.1689800844900424, + "grad_norm": 0.9907131195068359, + "learning_rate": 0.0003498181779509813, + "loss": 0.6101872444152832, + "mean_token_accuracy": 0.8196512959897518, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.6473788086617931, + "eval_loss": 0.7062397003173828, + "eval_mean_token_accuracy": 0.8078362184963869, + "eval_num_tokens": 2090604.0, + "eval_runtime": 88.6198, + "eval_samples_per_second": 16.024, + "eval_steps_per_second": 2.009, + "step": 900 + }, + { + "entropy": 0.6097332935780286, + "epoch": 2.2172601086300543, + "grad_norm": 0.9055633544921875, + "learning_rate": 0.00034857985786942026, + "loss": 0.5956094264984131, + "mean_token_accuracy": 0.8240575887262821, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.612629868341296, + "eval_loss": 0.7106770277023315, + "eval_mean_token_accuracy": 0.805324277181304, + "eval_num_tokens": 2142246.0, + "eval_runtime": 89.4383, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 920 + }, + { + "entropy": 0.6182701248675585, + "epoch": 2.2655401327700666, + "grad_norm": 0.9513736367225647, + "learning_rate": 0.00034729449985362404, + "loss": 0.6019269466400147, + "mean_token_accuracy": 0.8187106013298034, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6437647456533453, + "eval_loss": 0.7173502445220947, + "eval_mean_token_accuracy": 0.8056439573175451, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.9568, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 2.001, + "step": 940 + }, + { + "entropy": 0.6508570514619351, + "epoch": 2.3138201569100785, + "grad_norm": 0.9606207013130188, + "learning_rate": 0.0003459624676447067, + "loss": 0.6296409606933594, + "mean_token_accuracy": 0.8167732007801533, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6288247135248077, + "eval_loss": 0.7160675525665283, + "eval_mean_token_accuracy": 0.8066010689467527, + "eval_num_tokens": 2228098.0, + "eval_runtime": 89.0044, + "eval_samples_per_second": 15.954, + "eval_steps_per_second": 2.0, + "step": 960 + }, + { + "entropy": 0.6380081418901682, + "epoch": 2.3621001810500903, + "grad_norm": 0.9677181839942932, + "learning_rate": 0.000344584138192027, + "loss": 0.6210546493530273, + "mean_token_accuracy": 0.8186135642230511, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6407805031604981, + "eval_loss": 0.7055043578147888, + "eval_mean_token_accuracy": 0.8070103157772107, + "eval_num_tokens": 2273062.0, + "eval_runtime": 89.5606, + "eval_samples_per_second": 15.855, + "eval_steps_per_second": 1.987, + "step": 980 + }, + { + "entropy": 0.6310251638293266, + "epoch": 2.4103802051901027, + "grad_norm": 2.1046407222747803, + "learning_rate": 0.000343159901546516, + "loss": 0.6165830135345459, + "mean_token_accuracy": 0.8207855716347694, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6461507470420237, + "eval_loss": 0.7292136549949646, + "eval_mean_token_accuracy": 0.8030418261383356, + "eval_num_tokens": 2319305.0, + "eval_runtime": 89.315, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.993, + "step": 1000 + }, + { + "entropy": 0.6256617344915867, + "epoch": 2.4586602293301145, + "grad_norm": 1.1768349409103394, + "learning_rate": 0.0003416901607502972, + "loss": 0.6142709255218506, + "mean_token_accuracy": 0.8220669947564602, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6150523993406403, + "eval_loss": 0.7019563317298889, + "eval_mean_token_accuracy": 0.8094323099998946, + "eval_num_tokens": 2368592.0, + "eval_runtime": 89.419, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.991, + "step": 1020 + }, + { + "entropy": 0.6126735735684633, + "epoch": 2.506940253470127, + "grad_norm": 1.8065496683120728, + "learning_rate": 0.00034017533172263055, + "loss": 0.6056458473205566, + "mean_token_accuracy": 0.8203762136399746, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6544345456562685, + "eval_loss": 0.7086517214775085, + "eval_mean_token_accuracy": 0.806709805901131, + "eval_num_tokens": 2412859.0, + "eval_runtime": 88.981, + "eval_samples_per_second": 15.958, + "eval_steps_per_second": 2.0, + "step": 1040 + }, + { + "entropy": 0.6311754353344441, + "epoch": 2.5552202776101387, + "grad_norm": 1.0576369762420654, + "learning_rate": 0.00033861584314221236, + "loss": 0.6176392555236816, + "mean_token_accuracy": 0.8177410490810871, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6273799200406235, + "eval_loss": 0.708163321018219, + "eval_mean_token_accuracy": 0.8032017099053672, + "eval_num_tokens": 2458201.0, + "eval_runtime": 89.7668, + "eval_samples_per_second": 15.819, + "eval_steps_per_second": 1.983, + "step": 1060 + }, + { + "entropy": 0.6200249589979648, + "epoch": 2.603500301750151, + "grad_norm": 0.997065007686615, + "learning_rate": 0.0003370121363258637, + "loss": 0.6203888893127442, + "mean_token_accuracy": 0.8196275025606156, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6457576811983344, + "eval_loss": 0.6972290277481079, + "eval_mean_token_accuracy": 0.8095980849158898, + "eval_num_tokens": 2505382.0, + "eval_runtime": 89.2027, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 1080 + }, + { + "entropy": 0.626810473203659, + "epoch": 2.651780325890163, + "grad_norm": 0.865475058555603, + "learning_rate": 0.0003353646651036438, + "loss": 0.6102585792541504, + "mean_token_accuracy": 0.819708751142025, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.6412022431914726, + "eval_loss": 0.7036139965057373, + "eval_mean_token_accuracy": 0.8070317135098275, + "eval_num_tokens": 2552927.0, + "eval_runtime": 89.4733, + "eval_samples_per_second": 15.871, + "eval_steps_per_second": 1.989, + "step": 1100 + }, + { + "entropy": 0.6581619590520859, + "epoch": 2.700060350030175, + "grad_norm": 1.00307035446167, + "learning_rate": 0.00033367389569042064, + "loss": 0.6397720336914062, + "mean_token_accuracy": 0.81413309648633, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6288736402318719, + "eval_loss": 0.6966825723648071, + "eval_mean_token_accuracy": 0.8094039669867312, + "eval_num_tokens": 2597426.0, + "eval_runtime": 88.7341, + "eval_samples_per_second": 16.003, + "eval_steps_per_second": 2.006, + "step": 1120 + }, + { + "entropy": 0.6399412982165813, + "epoch": 2.748340374170187, + "grad_norm": 0.8589329719543457, + "learning_rate": 0.0003319403065539384, + "loss": 0.6347338199615479, + "mean_token_accuracy": 0.8139534957706929, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.683491913455256, + "eval_loss": 0.6984149217605591, + "eval_mean_token_accuracy": 0.8083989469522841, + "eval_num_tokens": 2640514.0, + "eval_runtime": 89.3929, + "eval_samples_per_second": 15.885, + "eval_steps_per_second": 1.991, + "step": 1140 + }, + { + "entropy": 0.6264835461974144, + "epoch": 2.796620398310199, + "grad_norm": 0.7807853817939758, + "learning_rate": 0.0003301643882794163, + "loss": 0.6162629127502441, + "mean_token_accuracy": 0.8216292977333068, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6578792159476977, + "eval_loss": 0.6921441555023193, + "eval_mean_token_accuracy": 0.8094299177775223, + "eval_num_tokens": 2687730.0, + "eval_runtime": 89.2356, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.995, + "step": 1160 + }, + { + "entropy": 0.6269129011780024, + "epoch": 2.8449004224502112, + "grad_norm": 1.1675593852996826, + "learning_rate": 0.0003283466434307189, + "loss": 0.6235532760620117, + "mean_token_accuracy": 0.8188897788524627, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6533248447970058, + "eval_loss": 0.696849524974823, + "eval_mean_token_accuracy": 0.8102703713968898, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2602, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.6259873781353236, + "epoch": 2.8931804465902236, + "grad_norm": 0.9596486687660217, + "learning_rate": 0.00032648758640813655, + "loss": 0.6118728160858155, + "mean_token_accuracy": 0.8171859130263328, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6212078754821521, + "eval_loss": 0.6942870020866394, + "eval_mean_token_accuracy": 0.810484343365337, + "eval_num_tokens": 2779450.0, + "eval_runtime": 89.4375, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.99, + "step": 1200 + }, + { + "entropy": 0.6142537571489811, + "epoch": 2.9414604707302354, + "grad_norm": 0.9625058770179749, + "learning_rate": 0.00032458774330281615, + "loss": 0.6060261249542236, + "mean_token_accuracy": 0.8223113484680653, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6553665667437436, + "eval_loss": 0.6835269331932068, + "eval_mean_token_accuracy": 0.8134723968720168, + "eval_num_tokens": 2827819.0, + "eval_runtime": 89.5092, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.989, + "step": 1220 + }, + { + "entropy": 0.6301972426474094, + "epoch": 2.9897404948702473, + "grad_norm": 0.9657333493232727, + "learning_rate": 0.0003226476517478835, + "loss": 0.6277759075164795, + "mean_token_accuracy": 0.8164266042411328, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6594253118788258, + "eval_loss": 0.6820935606956482, + "eval_mean_token_accuracy": 0.8132368198941263, + "eval_num_tokens": 2872493.0, + "eval_runtime": 89.6211, + "eval_samples_per_second": 15.844, + "eval_steps_per_second": 1.986, + "step": 1240 + }, + { + "entropy": 0.5346100655469027, + "epoch": 3.036210018105009, + "grad_norm": 0.8541185259819031, + "learning_rate": 0.0003206678607662996, + "loss": 0.5261692047119141, + "mean_token_accuracy": 0.8382289425119177, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5626645662476507, + "eval_loss": 0.7028542160987854, + "eval_mean_token_accuracy": 0.8133395572056931, + "eval_num_tokens": 2918249.0, + "eval_runtime": 89.1267, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.997, + "step": 1260 + }, + { + "entropy": 0.5001101832836866, + "epoch": 3.084490042245021, + "grad_norm": 0.8208815455436707, + "learning_rate": 0.0003186489306154935, + "loss": 0.4850132942199707, + "mean_token_accuracy": 0.8468983843922615, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5889462046743779, + "eval_loss": 0.691015899181366, + "eval_mean_token_accuracy": 0.8135226466012805, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.9677, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 2.001, + "step": 1280 + }, + { + "entropy": 0.5242766339331866, + "epoch": 3.1327700663850333, + "grad_norm": 0.7893072962760925, + "learning_rate": 0.0003165914326288163, + "loss": 0.5061577320098877, + "mean_token_accuracy": 0.8425608821213245, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5543691962957382, + "eval_loss": 0.6913734078407288, + "eval_mean_token_accuracy": 0.8154889680026622, + "eval_num_tokens": 3018291.0, + "eval_runtime": 89.6963, + "eval_samples_per_second": 15.831, + "eval_steps_per_second": 1.984, + "step": 1300 + }, + { + "entropy": 0.5327721010893584, + "epoch": 3.181050090525045, + "grad_norm": 0.8992080092430115, + "learning_rate": 0.0003144959490538604, + "loss": 0.5068036556243897, + "mean_token_accuracy": 0.8420542575418949, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5734540803378887, + "eval_loss": 0.6948716044425964, + "eval_mean_token_accuracy": 0.8137217944257715, + "eval_num_tokens": 3070712.0, + "eval_runtime": 89.4597, + "eval_samples_per_second": 15.873, + "eval_steps_per_second": 1.99, + "step": 1320 + }, + { + "entropy": 0.5247377116233111, + "epoch": 3.2293301146650575, + "grad_norm": 0.9291845560073853, + "learning_rate": 0.0003123630728876902, + "loss": 0.5023272037506104, + "mean_token_accuracy": 0.8435182586312294, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5492362935891312, + "eval_loss": 0.6980633735656738, + "eval_mean_token_accuracy": 0.8155082919624415, + "eval_num_tokens": 3116564.0, + "eval_runtime": 89.2124, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.995, + "step": 1340 + }, + { + "entropy": 0.5380499072372913, + "epoch": 3.2776101388050694, + "grad_norm": 1.0477524995803833, + "learning_rate": 0.00031019340770903136, + "loss": 0.5264591693878173, + "mean_token_accuracy": 0.8391959741711617, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5896503307511297, + "eval_loss": 0.6997144222259521, + "eval_mean_token_accuracy": 0.8124373062942805, + "eval_num_tokens": 3164054.0, + "eval_runtime": 89.1147, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.997, + "step": 1360 + }, + { + "entropy": 0.5460653610527515, + "epoch": 3.3258901629450817, + "grad_norm": 1.2473069429397583, + "learning_rate": 0.00030798756750746476, + "loss": 0.5319677829742432, + "mean_token_accuracy": 0.8364320226013661, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5659052182114526, + "eval_loss": 0.6924049258232117, + "eval_mean_token_accuracy": 0.8153053585732921, + "eval_num_tokens": 3207419.0, + "eval_runtime": 89.6468, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.986, + "step": 1380 + }, + { + "entropy": 0.5367407951503992, + "epoch": 3.3741701870850935, + "grad_norm": 1.2679712772369385, + "learning_rate": 0.00030574617650967485, + "loss": 0.5190927028656006, + "mean_token_accuracy": 0.8399469174444676, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5581759144081159, + "eval_loss": 0.6933317184448242, + "eval_mean_token_accuracy": 0.8139757862251796, + "eval_num_tokens": 3252679.0, + "eval_runtime": 89.0749, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.998, + "step": 1400 + }, + { + "entropy": 0.530736118927598, + "epoch": 3.4224502112251054, + "grad_norm": 0.9717612862586975, + "learning_rate": 0.0003034698690028009, + "loss": 0.512363052368164, + "mean_token_accuracy": 0.8419127956032753, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5233335836549823, + "eval_loss": 0.6958550214767456, + "eval_mean_token_accuracy": 0.8158778501360604, + "eval_num_tokens": 3297309.0, + "eval_runtime": 88.8664, + "eval_samples_per_second": 15.979, + "eval_steps_per_second": 2.003, + "step": 1420 + }, + { + "entropy": 0.5327631575986743, + "epoch": 3.4707302353651177, + "grad_norm": 0.7649208903312683, + "learning_rate": 0.00030115928915494116, + "loss": 0.5202179431915284, + "mean_token_accuracy": 0.8384683802723885, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.5960972657364406, + "eval_loss": 0.6984783411026001, + "eval_mean_token_accuracy": 0.8095930597085631, + "eval_num_tokens": 3341825.0, + "eval_runtime": 89.5168, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1440 + }, + { + "entropy": 0.5428155034780502, + "epoch": 3.51901025950513, + "grad_norm": 1.2790874242782593, + "learning_rate": 0.00029881509083286116, + "loss": 0.524717378616333, + "mean_token_accuracy": 0.8346644505858422, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.550318562917495, + "eval_loss": 0.6988471746444702, + "eval_mean_token_accuracy": 0.8132969897784544, + "eval_num_tokens": 3388463.0, + "eval_runtime": 89.2598, + "eval_samples_per_second": 15.909, + "eval_steps_per_second": 1.994, + "step": 1460 + }, + { + "entropy": 0.5489993002265692, + "epoch": 3.567290283645142, + "grad_norm": 1.055821418762207, + "learning_rate": 0.00029643793741695687, + "loss": 0.5421150207519532, + "mean_token_accuracy": 0.8345710933208466, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5816821718818685, + "eval_loss": 0.6853668689727783, + "eval_mean_token_accuracy": 0.8142332360985574, + "eval_num_tokens": 3433731.0, + "eval_runtime": 89.0424, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.999, + "step": 1480 + }, + { + "entropy": 0.5451365381479263, + "epoch": 3.6155703077851538, + "grad_norm": 0.9027532935142517, + "learning_rate": 0.00029402850161352583, + "loss": 0.5463609218597412, + "mean_token_accuracy": 0.8369908526539802, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5344233209832331, + "eval_loss": 0.6794531345367432, + "eval_mean_token_accuracy": 0.8177759824843889, + "eval_num_tokens": 3478600.0, + "eval_runtime": 89.123, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.997, + "step": 1500 + }, + { + "entropy": 0.5521467242389917, + "epoch": 3.663850331925166, + "grad_norm": 1.4606311321258545, + "learning_rate": 0.0002915874652643997, + "loss": 0.5421902179718018, + "mean_token_accuracy": 0.8339455373585224, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5807709094513668, + "eval_loss": 0.6949691772460938, + "eval_mean_token_accuracy": 0.8121141439743256, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.5437, + "eval_samples_per_second": 16.037, + "eval_steps_per_second": 2.01, + "step": 1520 + }, + { + "entropy": 0.5455610822886229, + "epoch": 3.712130356065178, + "grad_norm": 0.7269843220710754, + "learning_rate": 0.0002891155191539905, + "loss": 0.5407682895660401, + "mean_token_accuracy": 0.8393648222088814, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.6032205542151847, + "eval_loss": 0.6790974140167236, + "eval_mean_token_accuracy": 0.8165463112043531, + "eval_num_tokens": 3569036.0, + "eval_runtime": 89.517, + "eval_samples_per_second": 15.863, + "eval_steps_per_second": 1.988, + "step": 1540 + }, + { + "entropy": 0.5474163968116045, + "epoch": 3.7604103802051903, + "grad_norm": 0.8148866295814514, + "learning_rate": 0.00028661336281380717, + "loss": 0.5394441604614257, + "mean_token_accuracy": 0.8336028568446636, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5797032238392348, + "eval_loss": 0.670870304107666, + "eval_mean_token_accuracy": 0.8182691593518417, + "eval_num_tokens": 3614313.0, + "eval_runtime": 89.4468, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.99, + "step": 1560 + }, + { + "entropy": 0.5511750865727663, + "epoch": 3.808690404345202, + "grad_norm": 1.3441656827926636, + "learning_rate": 0.0002840817043244964, + "loss": 0.5378933906555176, + "mean_token_accuracy": 0.8349151819944381, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5297858750217417, + "eval_loss": 0.680833637714386, + "eval_mean_token_accuracy": 0.8180924275617921, + "eval_num_tokens": 3659786.0, + "eval_runtime": 89.5417, + "eval_samples_per_second": 15.859, + "eval_steps_per_second": 1.988, + "step": 1580 + }, + { + "entropy": 0.5379613988101483, + "epoch": 3.856970428485214, + "grad_norm": 0.9813932776451111, + "learning_rate": 0.00028152126011546396, + "loss": 0.5340342044830322, + "mean_token_accuracy": 0.8346010789275169, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5811898510777549, + "eval_loss": 0.6764267683029175, + "eval_mean_token_accuracy": 0.8180528236239144, + "eval_num_tokens": 3706362.0, + "eval_runtime": 88.7831, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 1600 + }, + { + "entropy": 0.5607876226305961, + "epoch": 3.9052504526252263, + "grad_norm": 0.9617928266525269, + "learning_rate": 0.00027893275476213383, + "loss": 0.5434338569641113, + "mean_token_accuracy": 0.8332898400723934, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5474644318390428, + "eval_loss": 0.6740226745605469, + "eval_mean_token_accuracy": 0.8185851306058047, + "eval_num_tokens": 3753013.0, + "eval_runtime": 89.3246, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.5354843523353339, + "epoch": 3.9535304767652386, + "grad_norm": 1.5320990085601807, + "learning_rate": 0.0002763169207809021, + "loss": 0.5251852989196777, + "mean_token_accuracy": 0.8416872084140777, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.5436856410141742, + "eval_loss": 0.6675190925598145, + "eval_mean_token_accuracy": 0.8202396507343549, + "eval_num_tokens": 3800024.0, + "eval_runtime": 89.6328, + "eval_samples_per_second": 15.842, + "eval_steps_per_second": 1.986, + "step": 1640 + }, + { + "entropy": 0.5418571938167919, + "epoch": 4.0, + "grad_norm": 4.690354347229004, + "learning_rate": 0.000273674498421843, + "loss": 0.548275089263916, + "mean_token_accuracy": 0.836557479647847, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5497228983747825, + "eval_loss": 0.6621812582015991, + "eval_mean_token_accuracy": 0.8205679802412398, + "eval_num_tokens": 3844304.0, + "eval_runtime": 89.6272, + "eval_samples_per_second": 15.843, + "eval_steps_per_second": 1.986, + "step": 1660 + }, + { + "entropy": 0.4195931971073151, + "epoch": 4.048280024140012, + "grad_norm": 0.6678048968315125, + "learning_rate": 0.0002710062354592273, + "loss": 0.3970795154571533, + "mean_token_accuracy": 0.8719995342195034, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.46495268753405367, + "eval_loss": 0.7061581611633301, + "eval_mean_token_accuracy": 0.8190107995204712, + "eval_num_tokens": 3890738.0, + "eval_runtime": 89.6387, + "eval_samples_per_second": 15.841, + "eval_steps_per_second": 1.986, + "step": 1680 + }, + { + "entropy": 0.4263830740004778, + "epoch": 4.096560048280024, + "grad_norm": 0.7026669383049011, + "learning_rate": 0.000268312886979911, + "loss": 0.398905086517334, + "mean_token_accuracy": 0.8691012300550938, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.45755320670229666, + "eval_loss": 0.7102291584014893, + "eval_mean_token_accuracy": 0.819212955370378, + "eval_num_tokens": 3938205.0, + "eval_runtime": 89.2777, + "eval_samples_per_second": 15.905, + "eval_steps_per_second": 1.994, + "step": 1700 + }, + { + "entropy": 0.41640330031514167, + "epoch": 4.1448400724200365, + "grad_norm": 0.752216100692749, + "learning_rate": 0.00026559521516965437, + "loss": 0.39748263359069824, + "mean_token_accuracy": 0.8684553548693656, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.469178682297803, + "eval_loss": 0.7004125714302063, + "eval_mean_token_accuracy": 0.8194386949030201, + "eval_num_tokens": 3986350.0, + "eval_runtime": 89.8428, + "eval_samples_per_second": 15.805, + "eval_steps_per_second": 1.981, + "step": 1720 + }, + { + "entropy": 0.42079071439802646, + "epoch": 4.193120096560048, + "grad_norm": 0.8349477648735046, + "learning_rate": 0.0002628539890974329, + "loss": 0.40129623413085935, + "mean_token_accuracy": 0.8686790131032467, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48358210871058904, + "eval_loss": 0.70196533203125, + "eval_mean_token_accuracy": 0.818096743875675, + "eval_num_tokens": 4033541.0, + "eval_runtime": 90.444, + "eval_samples_per_second": 15.7, + "eval_steps_per_second": 1.968, + "step": 1740 + }, + { + "entropy": 0.4285690750926733, + "epoch": 4.24140012070006, + "grad_norm": 0.781974732875824, + "learning_rate": 0.00026008998449779933, + "loss": 0.40457854270935056, + "mean_token_accuracy": 0.8679066866636276, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.4653420230645812, + "eval_loss": 0.7041526436805725, + "eval_mean_token_accuracy": 0.8190121017815022, + "eval_num_tokens": 4079253.0, + "eval_runtime": 89.5248, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.988, + "step": 1760 + }, + { + "entropy": 0.4335357129573822, + "epoch": 4.289680144840072, + "grad_norm": 0.8383703827857971, + "learning_rate": 0.0002573039835513604, + "loss": 0.41876921653747556, + "mean_token_accuracy": 0.8663770146667957, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.5015502416350869, + "eval_loss": 0.6904259324073792, + "eval_mean_token_accuracy": 0.8200626497188311, + "eval_num_tokens": 4125495.0, + "eval_runtime": 89.7014, + "eval_samples_per_second": 15.83, + "eval_steps_per_second": 1.984, + "step": 1780 + }, + { + "entropy": 0.4258002445101738, + "epoch": 4.337960168980085, + "grad_norm": 0.7313240766525269, + "learning_rate": 0.00025449677466342867, + "loss": 0.40549774169921876, + "mean_token_accuracy": 0.8665009342133999, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.49225394293833313, + "eval_loss": 0.6914838552474976, + "eval_mean_token_accuracy": 0.8200667657878962, + "eval_num_tokens": 4173422.0, + "eval_runtime": 91.6837, + "eval_samples_per_second": 15.488, + "eval_steps_per_second": 1.941, + "step": 1800 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.8035854016335258e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d5c23212dd31aedbbc7ce0ace97f36c8bf2c5fc0 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/trainer_state.json @@ -0,0 +1,2113 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.772480386240193, + "eval_steps": 20, + "global_step": 1980, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.9366227277457203e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..eab9ea30e4820a6d866de21279b332866b819921 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/trainer_state.json @@ -0,0 +1,55 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.04828002414001207, + "eval_steps": 20, + "global_step": 20, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1980622700961792.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e7faecad0e5485d520712f4c86398d7523e2de06 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/trainer_state.json @@ -0,0 +1,244 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.4828002414001207, + "eval_steps": 20, + "global_step": 200, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.002938588074803e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e06986da34f4cc6d65c9433694a91294c02506eb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/trainer_state.json @@ -0,0 +1,2134 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.820760410380205, + "eval_steps": 20, + "global_step": 2000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.956564043065692e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bdead565fe99ea51bad173a428f597c421f16a98 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/trainer_state.json @@ -0,0 +1,2155 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.869040434520217, + "eval_steps": 20, + "global_step": 2020, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.9775676437352653e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..18b70d75d7f9bdc19ef082b899bc65a900ed4d30 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/trainer_state.json @@ -0,0 +1,2176 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.917320458660229, + "eval_steps": 20, + "global_step": 2040, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.996087023009239e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ae0000c47a490271cc79a5c820e49d114a36d2f4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/trainer_state.json @@ -0,0 +1,2197 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.965600482800241, + "eval_steps": 20, + "global_step": 2060, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.0141362247874355e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b7f001f4ad835f76a021df2902e492496dbef859 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/trainer_state.json @@ -0,0 +1,2218 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.012070006035003, + "eval_steps": 20, + "global_step": 2080, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.034164382592635e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..23122add48828c62f5dfd1b8913cc0ef3376325d --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/trainer_state.json @@ -0,0 +1,2239 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.060350030175015, + "eval_steps": 20, + "global_step": 2100, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.0530469213502874e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ba4b833ba7fad512f560f4e4c617f59c00606992 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/trainer_state.json @@ -0,0 +1,2260 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.108630054315027, + "eval_steps": 20, + "global_step": 2120, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.0717110380996403e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7c1a61156389705a460f54812d7f7df87005f47a --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/trainer_state.json @@ -0,0 +1,2281 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.15691007845504, + "eval_steps": 20, + "global_step": 2140, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.090833051589284e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b54988c810517ebf71a916cd105e89338d8523b3 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/trainer_state.json @@ -0,0 +1,2302 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.2051901025950515, + "eval_steps": 20, + "global_step": 2160, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.1095296246209946e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..35c335e5ed20742fda69ad42952b2144c78acbca --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/trainer_state.json @@ -0,0 +1,2323 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.253470126735063, + "eval_steps": 20, + "global_step": 2180, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.129812169504133e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ec51bf7ad065cdf131531cea62b9ceb5714d3d87 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/trainer_state.json @@ -0,0 +1,265 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.5310802655401328, + "eval_steps": 20, + "global_step": 220, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.18071129571328e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5c3fdd27c8a15e3c4297cf6c17c1eaa51c624b4e --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/trainer_state.json @@ -0,0 +1,2344 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.301750150875075, + "eval_steps": 20, + "global_step": 2200, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.148549093589586e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bede130010a92c3e190957528ee99ee9d7d8ccd4 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/trainer_state.json @@ -0,0 +1,2365 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.350030175015087, + "eval_steps": 20, + "global_step": 2220, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.1683140923486413e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4a0e1cd5bb5fe1d1f02099decc715eabb5528449 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/trainer_state.json @@ -0,0 +1,2386 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.3983101991551, + "eval_steps": 20, + "global_step": 2240, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.187844002359808e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..90385fc1cfffc72e6015903d9795ab9751642b03 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/trainer_state.json @@ -0,0 +1,2407 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.446590223295112, + "eval_steps": 20, + "global_step": 2260, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.2065818036420813e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..50eb2da858d6ef868950c637dcedb3aa44828272 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/trainer_state.json @@ -0,0 +1,2428 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.494870247435124, + "eval_steps": 20, + "global_step": 2280, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.2258836424799232e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..821e06b5d757bad8f96e5c4bce613a90e3de2ef2 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/trainer_state.json @@ -0,0 +1,2449 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.5431502715751355, + "eval_steps": 20, + "global_step": 2300, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.2464670658724864e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6439d770fe64ebcb1a34ad597aa135d3352bd1f2 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/trainer_state.json @@ -0,0 +1,2470 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.591430295715147, + "eval_steps": 20, + "global_step": 2320, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.2683092667024384e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4556c146abe3b666205842349ce1a29d57b68fa3 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/trainer_state.json @@ -0,0 +1,2491 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.63971031985516, + "eval_steps": 20, + "global_step": 2340, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.2901076076913664e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..157c6c9b89652a3e5de38736e229df11dd977773 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/trainer_state.json @@ -0,0 +1,2512 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.687990343995172, + "eval_steps": 20, + "global_step": 2360, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.310536644443525e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..fdc762f0617759ecd83412579f007fe2f40fd706 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/trainer_state.json @@ -0,0 +1,2533 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.736270368135184, + "eval_steps": 20, + "global_step": 2380, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.3297955006371635e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..28ee29eb84e32c864fe215caffb4de6dbf6b73b0 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/trainer_state.json @@ -0,0 +1,286 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.5793602896801449, + "eval_steps": 20, + "global_step": 240, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.3722647654014976e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..658f64f023d7d3289f20913d8b01c71f87f87040 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/trainer_state.json @@ -0,0 +1,2554 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.784550392275197, + "eval_steps": 20, + "global_step": 2400, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.3500657647648154e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0347929814804d1c54b132e8f575a7949fb009eb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/trainer_state.json @@ -0,0 +1,2575 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.8328304164152085, + "eval_steps": 20, + "global_step": 2420, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.3693877791295283e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..38d1d28b4867fec18c718259a9a02eb71b7e3d7d --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/trainer_state.json @@ -0,0 +1,2596 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.88111044055522, + "eval_steps": 20, + "global_step": 2440, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.3887703200748544e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e33dc1a49f4e7849aea0e667f057ffd370152dab --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/trainer_state.json @@ -0,0 +1,2617 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.929390464695232, + "eval_steps": 20, + "global_step": 2460, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.4083888269648896e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4af553a6bee24b4082c5d5febd51b7af653e9d89 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/trainer_state.json @@ -0,0 +1,2638 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.977670488835244, + "eval_steps": 20, + "global_step": 2480, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.4278713683477504e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..1ace1eb34540ce725bea5745e358df0fadc5f9f9 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/trainer_state.json @@ -0,0 +1,2659 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.024140012070006, + "eval_steps": 20, + "global_step": 2500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.4485023796678246e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a0b8f1794fa4884b4d51a2123faf3aabb9fe53f7 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/trainer_state.json @@ -0,0 +1,2680 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.072420036210018, + "eval_steps": 20, + "global_step": 2520, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.4673068479084544e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..fb40c6512296edce2c96ff535850961a0b38eabd --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/trainer_state.json @@ -0,0 +1,2701 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.12070006035003, + "eval_steps": 20, + "global_step": 2540, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.486442019350405e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..23dc97df31f24e5c1b5e4b7aa2c7c1e440c56b32 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/trainer_state.json @@ -0,0 +1,2722 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.168980084490042, + "eval_steps": 20, + "global_step": 2560, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.5044105190211174e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..533448a9cbe849fb25d8f5edefdf89bf4154b86d --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/trainer_state.json @@ -0,0 +1,2743 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.217260108630055, + "eval_steps": 20, + "global_step": 2580, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.5242299039830426e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..40b26c99f97f7b5375db99d6e691bb2d6a722c0d --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/trainer_state.json @@ -0,0 +1,307 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.627640313820157, + "eval_steps": 20, + "global_step": 260, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.560572606853939e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..dc47727306f2833936a6a92ed5b0743598bac4bf --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/trainer_state.json @@ -0,0 +1,2764 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.265540132770067, + "eval_steps": 20, + "global_step": 2600, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.5449440297018573e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b233f0f90b67711aa2731c9af3065f360a8d82b8 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/trainer_state.json @@ -0,0 +1,2785 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.3138201569100785, + "eval_steps": 20, + "global_step": 2620, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.5660011393774797e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..dccc2cc2014751816288ad918b68c267d2cd42ed --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/trainer_state.json @@ -0,0 +1,2806 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.36210018105009, + "eval_steps": 20, + "global_step": 2640, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.5865819311795814e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5dc056fb2ddd521095113ec7bd517d2c67a746c8 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/trainer_state.json @@ -0,0 +1,2827 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.410380205190102, + "eval_steps": 20, + "global_step": 2660, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.6047513089221837e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d82401e2a088e0ff250f5d6d44599a7b2e18cbef --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/trainer_state.json @@ -0,0 +1,2848 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.458660229330115, + "eval_steps": 20, + "global_step": 2680, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.6248496424730214e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a3f26bcedeca9fd56cbb640e3bde811d7268725b --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/trainer_state.json @@ -0,0 +1,2869 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.506940253470127, + "eval_steps": 20, + "global_step": 2700, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.6441006038952755e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..836f2b4ceafffd600f4d0abce044a8a37ec9b69f --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/trainer_state.json @@ -0,0 +1,2890 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.555220277610139, + "eval_steps": 20, + "global_step": 2720, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.661749803923333e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..43091e391c2a98f529473101ed677d1b7068092e --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/trainer_state.json @@ -0,0 +1,2911 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.603500301750151, + "eval_steps": 20, + "global_step": 2740, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.680984098605998e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8171cad0986f96f0e07b201f89d911322ee805dc --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/trainer_state.json @@ -0,0 +1,2932 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.651780325890163, + "eval_steps": 20, + "global_step": 2760, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.700181551022203e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f6198de356a225b47482c578a30b4baddc367b91 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/trainer_state.json @@ -0,0 +1,2953 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.700060350030175, + "eval_steps": 20, + "global_step": 2780, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.718843913377915e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7206c7b360a82d6e5e345ecba613257b021b5ff7 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/trainer_state.json @@ -0,0 +1,328 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.6759203379601689, + "eval_steps": 20, + "global_step": 280, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.760327866813645e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..1fc0258615ad8cbcdcf2c3c77b60ccfc04b7bbea --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/trainer_state.json @@ -0,0 +1,2974 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.748340374170187, + "eval_steps": 20, + "global_step": 2800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.737784347125719e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..9207b60ec65ed234952c48bafe27b126be401ce2 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/trainer_state.json @@ -0,0 +1,2995 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.796620398310199, + "eval_steps": 20, + "global_step": 2820, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.758241454176133e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..699bf58eeba3578ce90d2b4e07d408cf5dd224e6 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/trainer_state.json @@ -0,0 +1,3016 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.844900422450211, + "eval_steps": 20, + "global_step": 2840, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.778160839575593e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e5849bb70f4695e15fe28f32e6d545d1781c7730 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/trainer_state.json @@ -0,0 +1,3037 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.8931804465902236, + "eval_steps": 20, + "global_step": 2860, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.7973670639600026e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..29a7a061a67675c58c5923c417c54476b64e95d6 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/trainer_state.json @@ -0,0 +1,3058 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.941460470730235, + "eval_steps": 20, + "global_step": 2880, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.8180978564184064e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b436411be2d5b941b5aeb9cb48e88f6f89ccc12d --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/trainer_state.json @@ -0,0 +1,3079 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 6.989740494870247, + "eval_steps": 20, + "global_step": 2900, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.837826890107822e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..1394feb251929998c89f62f76218e56db8e5f61b --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/trainer_state.json @@ -0,0 +1,3100 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.036210018105009, + "eval_steps": 20, + "global_step": 2920, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.8573758791498342e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..01b999feaf411c5742fbb6e32f9c1c0f07fc71f2 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/trainer_state.json @@ -0,0 +1,3121 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.084490042245021, + "eval_steps": 20, + "global_step": 2940, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.8770347370936115e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..378849b7d6d9ba4a4d0d9698df6ebf280bf30d46 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/trainer_state.json @@ -0,0 +1,3142 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.132770066385033, + "eval_steps": 20, + "global_step": 2960, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.896958508477174e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a99d74567808158f22169cf3a9c5fe2165b522d9 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/trainer_state.json @@ -0,0 +1,3163 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.181050090525045, + "eval_steps": 20, + "global_step": 2980, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.915818240117494e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..027156dcbaeda5daeb9ced7e720bd84de71eec8f --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/trainer_state.json @@ -0,0 +1,349 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.724200362100181, + "eval_steps": 20, + "global_step": 300, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.9639427927834624e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a5db819bd0bb4d2cbdd0965bacfe6d1c04ec5aea --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/trainer_state.json @@ -0,0 +1,3184 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.229330114665057, + "eval_steps": 20, + "global_step": 3000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.937224474127667e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c77d20c645623dc039a24d854c6b2118e9ac3c53 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/trainer_state.json @@ -0,0 +1,3205 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.27761013880507, + "eval_steps": 20, + "global_step": 3020, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.956919297141084e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bf34fbaf82e4bc333c3b02d1e92c511f797813c0 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/trainer_state.json @@ -0,0 +1,3226 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.325890162945082, + "eval_steps": 20, + "global_step": 3040, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.976495698583736e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b5aef08d8b661f5ae26f8e38af21116c1bee1d71 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/trainer_state.json @@ -0,0 +1,3247 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.3741701870850935, + "eval_steps": 20, + "global_step": 3060, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.995756309171016e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2a7b4c5a16d20bf7d57b86c0b8f3b2930f26c3d3 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/trainer_state.json @@ -0,0 +1,3268 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.422450211225105, + "eval_steps": 20, + "global_step": 3080, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.015762537055703e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7dfd497e9c3fd8375fa6b3b75d267b555dac6400 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/trainer_state.json @@ -0,0 +1,3289 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.470730235365117, + "eval_steps": 20, + "global_step": 3100, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.034539812194898e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..042fc9852a9ce37e7c10e7a57550f3ecf23579bf --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/trainer_state.json @@ -0,0 +1,3310 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.51901025950513, + "eval_steps": 20, + "global_step": 3120, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.0549048135791616e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5bcb1354e8685276cb0a128d96fe86a3c28424c5 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3140/trainer_state.json @@ -0,0 +1,3331 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.567290283645142, + "eval_steps": 20, + "global_step": 3140, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.076369819776307e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..775448264fd381dfe599d9c8c3bfac8b25ae5684 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3160/trainer_state.json @@ -0,0 +1,3352 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.615570307785154, + "eval_steps": 20, + "global_step": 3160, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.095971659926753e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2c70abb0b86d1b62a66f938d28608c353d94b669 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3180/trainer_state.json @@ -0,0 +1,3373 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.663850331925166, + "eval_steps": 20, + "global_step": 3180, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.115362095643464e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..40d6676d519fcec5ea94ebcefa75c8df50db5e20 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-320/trainer_state.json @@ -0,0 +1,370 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.7724803862401931, + "eval_steps": 20, + "global_step": 320, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.1722770376474624e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..252b2efb2a6db9926dfbdc1e3bccd627e1590a83 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3200/trainer_state.json @@ -0,0 +1,3394 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.712130356065178, + "eval_steps": 20, + "global_step": 3200, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.13355691209386e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7e84d39b83ead9f531b7f0686ab9d5cfe3971e42 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3220/trainer_state.json @@ -0,0 +1,3415 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.76041038020519, + "eval_steps": 20, + "global_step": 3220, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.153286822980096e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..67fa39ea74ee718a4081090762b2ef362f896168 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3240/trainer_state.json @@ -0,0 +1,3436 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.808690404345202, + "eval_steps": 20, + "global_step": 3240, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.174001825895731e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..adb1dabaf9974867e381829bd49c87124e1d9622 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3260/trainer_state.json @@ -0,0 +1,3457 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.856970428485214, + "eval_steps": 20, + "global_step": 3260, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.1936536662649446e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..fb825e240dda35ae0a0bf35dc9686f1079adf38c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3280/trainer_state.json @@ -0,0 +1,3478 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.905250452625227, + "eval_steps": 20, + "global_step": 3280, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.212524801463931e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..495293dc25eda8fe690801b8cc9f4600865c1517 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3300/trainer_state.json @@ -0,0 +1,3499 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 7.953530476765239, + "eval_steps": 20, + "global_step": 3300, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.2321661154712986e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4c53da8266592955dba5e41ee9086fc0d2dc93c6 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3320/trainer_state.json @@ -0,0 +1,3520 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.0, + "eval_steps": 20, + "global_step": 3320, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.250573432851456e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..fa6ab53c1fe48c20eba37b9d5db217a69501c1b9 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3340/trainer_state.json @@ -0,0 +1,3541 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.048280024140013, + "eval_steps": 20, + "global_step": 3340, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.2692989533782426e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..cb9b866c360a800b59d15a38bc7131adbeb4bbc7 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3360/trainer_state.json @@ -0,0 +1,3562 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.096560048280024, + "eval_steps": 20, + "global_step": 3360, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.287402541359309e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a2fc8f1636d418550b9924543d042452222d6c21 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3380/trainer_state.json @@ -0,0 +1,3583 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.144840072420036, + "eval_steps": 20, + "global_step": 3380, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.3070622764999066e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..74f3aae32ad3b234a7b009ba629139b2fe08d2e5 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-340/trainer_state.json @@ -0,0 +1,391 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.8207604103802052, + "eval_steps": 20, + "global_step": 340, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.378479694237696e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..08fc4c3570c19f6e0a2c0d8a76c14e4ef01f07f0 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3400/trainer_state.json @@ -0,0 +1,3604 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.193120096560047, + "eval_steps": 20, + "global_step": 3400, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.3285974584426906e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2db801ca833cb1192fbe01b8cfb97880c3c13676 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3420/trainer_state.json @@ -0,0 +1,3625 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.24140012070006, + "eval_steps": 20, + "global_step": 3420, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.349095793743667e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..03ca086c00f1238eba904e496343ceb40e61967e --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3440/trainer_state.json @@ -0,0 +1,3646 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.289680144840073, + "eval_steps": 20, + "global_step": 3440, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.366551133274399e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..57cfa3bf8dd6a82e8e6e9931763bb156692d5b9d --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3460/trainer_state.json @@ -0,0 +1,3667 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.337960168980084, + "eval_steps": 20, + "global_step": 3460, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.386422272848732e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b56321eace4e4aeb99d65166959aae545d8c066b --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3480/trainer_state.json @@ -0,0 +1,3688 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.386240193120097, + "eval_steps": 20, + "global_step": 3480, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.406589904948388e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b43026a2f0b10b68026ae8a3c32b567280605fb2 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3500/trainer_state.json @@ -0,0 +1,3709 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.43452021726011, + "eval_steps": 20, + "global_step": 3500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.426522448300155e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..42411db050929ee1d8b9ea04edafa04bef1772b6 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3520/trainer_state.json @@ -0,0 +1,3730 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.48280024140012, + "eval_steps": 20, + "global_step": 3520, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.446115516482396e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..408c160e6c4bb39c0ea79d206f052bbef4ce7529 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3540/trainer_state.json @@ -0,0 +1,3751 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.531080265540133, + "eval_steps": 20, + "global_step": 3540, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.466217358820516e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c9ab7258db236e437a7d49026c4805445b161a50 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3560/trainer_state.json @@ -0,0 +1,3772 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.579360289680144, + "eval_steps": 20, + "global_step": 3560, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.4858621816151654e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bce0bdf22b40c7a2adba658254ce46eebe4bf201 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3580/trainer_state.json @@ -0,0 +1,3793 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.627640313820157, + "eval_steps": 20, + "global_step": 3580, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.5056596366565786e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..aa40e067342ae28e23f5106e938f5704a0d46fc1 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-360/trainer_state.json @@ -0,0 +1,412 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.8690404345202173, + "eval_steps": 20, + "global_step": 360, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.5625769909518336e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7a80a14dbbe5bbc20dafdf83628208fd93e65346 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3600/trainer_state.json @@ -0,0 +1,3814 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.67592033796017, + "eval_steps": 20, + "global_step": 3600, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.5255281446404506e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..1573ce2909ecc20301e76c24fe61c9ee7b21f0f6 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3620/trainer_state.json @@ -0,0 +1,3835 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.72420036210018, + "eval_steps": 20, + "global_step": 3620, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.5458370054282035e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..291f00c7d5f67f5da42aeb5da6b0715cad8093ee --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3640/trainer_state.json @@ -0,0 +1,3856 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.772480386240193, + "eval_steps": 20, + "global_step": 3640, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.566340603910103e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ecf670b7612b5ded3d0bcd29236d313f48d37a97 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3660/trainer_state.json @@ -0,0 +1,3877 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.820760410380204, + "eval_steps": 20, + "global_step": 3660, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.584905597418742e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bc82703251903e46caa7318691725fb801439c9a --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3680/trainer_state.json @@ -0,0 +1,3898 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.869040434520217, + "eval_steps": 20, + "global_step": 3680, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.6046714733746176e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..22407ada44ef458b856b92d794cf64c461954ab8 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3700/trainer_state.json @@ -0,0 +1,3919 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.91732045866023, + "eval_steps": 20, + "global_step": 3700, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.6235566437227315e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..09cb9abcc13e89b01c2aa4b9a6e99cf53549a24a --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3720/trainer_state.json @@ -0,0 +1,3940 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 8.965600482800241, + "eval_steps": 20, + "global_step": 3720, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.6437102406732595e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bacad24a5b7c9a8de0255a2c23ae3882702f7edd --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3740/trainer_state.json @@ -0,0 +1,3961 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.012070006035003, + "eval_steps": 20, + "global_step": 3740, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.662200233853747e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f76776ca4eeda3bf7bc462e883fefa9e10a7509f --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3760/trainer_state.json @@ -0,0 +1,3982 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.060350030175016, + "eval_steps": 20, + "global_step": 3760, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.6810055792911974e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..33ceb284384171e1992955899b3b8adc27fb3dc1 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3780/trainer_state.json @@ -0,0 +1,4003 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.108630054315027, + "eval_steps": 20, + "global_step": 3780, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.6994065369944064e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..96c5444d306695bfaadc8bc0a7e5eaa3f67510b7 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-380/trainer_state.json @@ -0,0 +1,433 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.9173204586602294, + "eval_steps": 20, + "global_step": 380, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.735218097190502e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..718c50884ac8267ab29bedb267772c7c6c8006e7 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3800/trainer_state.json @@ -0,0 +1,4024 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.15691007845504, + "eval_steps": 20, + "global_step": 3800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.7204776818191565e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5f76988076a1cc0adc313032629bc17e1e7e2066 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3820/trainer_state.json @@ -0,0 +1,4045 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.20519010259505, + "eval_steps": 20, + "global_step": 3820, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.7405672434017894e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6c07ec60a405e6c17924fde8c2f29b3c473dfa50 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3840/trainer_state.json @@ -0,0 +1,4066 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.253470126735063, + "eval_steps": 20, + "global_step": 3840, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.761387509935882e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e5fc2e8411c67c126118e479b8d71f3c48e368ff --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3860/trainer_state.json @@ -0,0 +1,4087 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.301750150875076, + "eval_steps": 20, + "global_step": 3860, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.7804174177593754e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..97fa7ff9b2780a2d7b36bcd032956628c61378e7 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3880/trainer_state.json @@ -0,0 +1,4108 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.350030175015087, + "eval_steps": 20, + "global_step": 3880, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.801052595764347e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b2b935637affd61973a50c17c877c09a3e3dba40 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3900/trainer_state.json @@ -0,0 +1,4129 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.3983101991551, + "eval_steps": 20, + "global_step": 3900, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + }, + { + "entropy": 0.08905019680969417, + "epoch": 9.3983101991551, + "grad_norm": 0.21842406690120697, + "learning_rate": 4.177449088611095e-06, + "loss": 0.06666865348815917, + "mean_token_accuracy": 0.9753445640206337, + "num_tokens": 9033383.0, + "step": 3900 + }, + { + "epoch": 9.3983101991551, + "eval_entropy": 0.2295504841911659, + "eval_loss": 1.0662461519241333, + "eval_mean_token_accuracy": 0.8284122297603093, + "eval_num_tokens": 9033383.0, + "eval_runtime": 88.5525, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.01, + "step": 3900 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.819766712732467e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e326084479ff5f78f5a9e96bd3232ad4b8b29d7a --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3920/trainer_state.json @@ -0,0 +1,4150 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.446590223295111, + "eval_steps": 20, + "global_step": 3920, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + }, + { + "entropy": 0.08905019680969417, + "epoch": 9.3983101991551, + "grad_norm": 0.21842406690120697, + "learning_rate": 4.177449088611095e-06, + "loss": 0.06666865348815917, + "mean_token_accuracy": 0.9753445640206337, + "num_tokens": 9033383.0, + "step": 3900 + }, + { + "epoch": 9.3983101991551, + "eval_entropy": 0.2295504841911659, + "eval_loss": 1.0662461519241333, + "eval_mean_token_accuracy": 0.8284122297603093, + "eval_num_tokens": 9033383.0, + "eval_runtime": 88.5525, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.01, + "step": 3900 + }, + { + "entropy": 0.08582521872594953, + "epoch": 9.446590223295111, + "grad_norm": 0.2000240683555603, + "learning_rate": 3.540256122150088e-06, + "loss": 0.06327944993972778, + "mean_token_accuracy": 0.9765432856976985, + "num_tokens": 9079672.0, + "step": 3920 + }, + { + "epoch": 9.446590223295111, + "eval_entropy": 0.2297678625818049, + "eval_loss": 1.0676169395446777, + "eval_mean_token_accuracy": 0.8283703879693921, + "eval_num_tokens": 9079672.0, + "eval_runtime": 87.6897, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 3920 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.8395843433007514e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..659ace35f2cef18fe37a3476dec1ba5a47377f86 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3940/trainer_state.json @@ -0,0 +1,4171 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.494870247435124, + "eval_steps": 20, + "global_step": 3940, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + }, + { + "entropy": 0.08905019680969417, + "epoch": 9.3983101991551, + "grad_norm": 0.21842406690120697, + "learning_rate": 4.177449088611095e-06, + "loss": 0.06666865348815917, + "mean_token_accuracy": 0.9753445640206337, + "num_tokens": 9033383.0, + "step": 3900 + }, + { + "epoch": 9.3983101991551, + "eval_entropy": 0.2295504841911659, + "eval_loss": 1.0662461519241333, + "eval_mean_token_accuracy": 0.8284122297603093, + "eval_num_tokens": 9033383.0, + "eval_runtime": 88.5525, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.01, + "step": 3900 + }, + { + "entropy": 0.08582521872594953, + "epoch": 9.446590223295111, + "grad_norm": 0.2000240683555603, + "learning_rate": 3.540256122150088e-06, + "loss": 0.06327944993972778, + "mean_token_accuracy": 0.9765432856976985, + "num_tokens": 9079672.0, + "step": 3920 + }, + { + "epoch": 9.446590223295111, + "eval_entropy": 0.2297678625818049, + "eval_loss": 1.0676169395446777, + "eval_mean_token_accuracy": 0.8283703879693921, + "eval_num_tokens": 9079672.0, + "eval_runtime": 87.6897, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 3920 + }, + { + "entropy": 0.09261773955076932, + "epoch": 9.494870247435124, + "grad_norm": 0.19104281067848206, + "learning_rate": 2.955303652656991e-06, + "loss": 0.06111966967582703, + "mean_token_accuracy": 0.9738784030079841, + "num_tokens": 9127647.0, + "step": 3940 + }, + { + "epoch": 9.494870247435124, + "eval_entropy": 0.22986975881490815, + "eval_loss": 1.0687925815582275, + "eval_mean_token_accuracy": 0.8282996858103892, + "eval_num_tokens": 9127647.0, + "eval_runtime": 88.2224, + "eval_samples_per_second": 16.096, + "eval_steps_per_second": 2.018, + "step": 3940 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.859804607209636e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..14c38f67f8dfc98059ebd429f4295856a62d195e --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3960/trainer_state.json @@ -0,0 +1,4192 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.543150271575136, + "eval_steps": 20, + "global_step": 3960, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + }, + { + "entropy": 0.08905019680969417, + "epoch": 9.3983101991551, + "grad_norm": 0.21842406690120697, + "learning_rate": 4.177449088611095e-06, + "loss": 0.06666865348815917, + "mean_token_accuracy": 0.9753445640206337, + "num_tokens": 9033383.0, + "step": 3900 + }, + { + "epoch": 9.3983101991551, + "eval_entropy": 0.2295504841911659, + "eval_loss": 1.0662461519241333, + "eval_mean_token_accuracy": 0.8284122297603093, + "eval_num_tokens": 9033383.0, + "eval_runtime": 88.5525, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.01, + "step": 3900 + }, + { + "entropy": 0.08582521872594953, + "epoch": 9.446590223295111, + "grad_norm": 0.2000240683555603, + "learning_rate": 3.540256122150088e-06, + "loss": 0.06327944993972778, + "mean_token_accuracy": 0.9765432856976985, + "num_tokens": 9079672.0, + "step": 3920 + }, + { + "epoch": 9.446590223295111, + "eval_entropy": 0.2297678625818049, + "eval_loss": 1.0676169395446777, + "eval_mean_token_accuracy": 0.8283703879693921, + "eval_num_tokens": 9079672.0, + "eval_runtime": 87.6897, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 3920 + }, + { + "entropy": 0.09261773955076932, + "epoch": 9.494870247435124, + "grad_norm": 0.19104281067848206, + "learning_rate": 2.955303652656991e-06, + "loss": 0.06111966967582703, + "mean_token_accuracy": 0.9738784030079841, + "num_tokens": 9127647.0, + "step": 3940 + }, + { + "epoch": 9.494870247435124, + "eval_entropy": 0.22986975881490815, + "eval_loss": 1.0687925815582275, + "eval_mean_token_accuracy": 0.8282996858103892, + "eval_num_tokens": 9127647.0, + "eval_runtime": 88.2224, + "eval_samples_per_second": 16.096, + "eval_steps_per_second": 2.018, + "step": 3940 + }, + { + "entropy": 0.08347254800610245, + "epoch": 9.543150271575136, + "grad_norm": 0.18671369552612305, + "learning_rate": 2.422757214761356e-06, + "loss": 0.06384263038635254, + "mean_token_accuracy": 0.9770128890872002, + "num_tokens": 9172587.0, + "step": 3960 + }, + { + "epoch": 9.543150271575136, + "eval_entropy": 0.22975517851248217, + "eval_loss": 1.0701013803482056, + "eval_mean_token_accuracy": 0.8282244285840666, + "eval_num_tokens": 9172587.0, + "eval_runtime": 88.5794, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 3960 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.87856170682196e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..3391e518c009fb23e7fe7e06eecdd8f2635c2635 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3980/trainer_state.json @@ -0,0 +1,4213 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.591430295715147, + "eval_steps": 20, + "global_step": 3980, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + }, + { + "entropy": 0.08905019680969417, + "epoch": 9.3983101991551, + "grad_norm": 0.21842406690120697, + "learning_rate": 4.177449088611095e-06, + "loss": 0.06666865348815917, + "mean_token_accuracy": 0.9753445640206337, + "num_tokens": 9033383.0, + "step": 3900 + }, + { + "epoch": 9.3983101991551, + "eval_entropy": 0.2295504841911659, + "eval_loss": 1.0662461519241333, + "eval_mean_token_accuracy": 0.8284122297603093, + "eval_num_tokens": 9033383.0, + "eval_runtime": 88.5525, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.01, + "step": 3900 + }, + { + "entropy": 0.08582521872594953, + "epoch": 9.446590223295111, + "grad_norm": 0.2000240683555603, + "learning_rate": 3.540256122150088e-06, + "loss": 0.06327944993972778, + "mean_token_accuracy": 0.9765432856976985, + "num_tokens": 9079672.0, + "step": 3920 + }, + { + "epoch": 9.446590223295111, + "eval_entropy": 0.2297678625818049, + "eval_loss": 1.0676169395446777, + "eval_mean_token_accuracy": 0.8283703879693921, + "eval_num_tokens": 9079672.0, + "eval_runtime": 87.6897, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 3920 + }, + { + "entropy": 0.09261773955076932, + "epoch": 9.494870247435124, + "grad_norm": 0.19104281067848206, + "learning_rate": 2.955303652656991e-06, + "loss": 0.06111966967582703, + "mean_token_accuracy": 0.9738784030079841, + "num_tokens": 9127647.0, + "step": 3940 + }, + { + "epoch": 9.494870247435124, + "eval_entropy": 0.22986975881490815, + "eval_loss": 1.0687925815582275, + "eval_mean_token_accuracy": 0.8282996858103892, + "eval_num_tokens": 9127647.0, + "eval_runtime": 88.2224, + "eval_samples_per_second": 16.096, + "eval_steps_per_second": 2.018, + "step": 3940 + }, + { + "entropy": 0.08347254800610245, + "epoch": 9.543150271575136, + "grad_norm": 0.18671369552612305, + "learning_rate": 2.422757214761356e-06, + "loss": 0.06384263038635254, + "mean_token_accuracy": 0.9770128890872002, + "num_tokens": 9172587.0, + "step": 3960 + }, + { + "epoch": 9.543150271575136, + "eval_entropy": 0.22975517851248217, + "eval_loss": 1.0701013803482056, + "eval_mean_token_accuracy": 0.8282244285840666, + "eval_num_tokens": 9172587.0, + "eval_runtime": 88.5794, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 3960 + }, + { + "entropy": 0.08136763009242713, + "epoch": 9.591430295715147, + "grad_norm": 0.24811454117298126, + "learning_rate": 1.942767512805673e-06, + "loss": 0.06044899821281433, + "mean_token_accuracy": 0.9776685133576393, + "num_tokens": 9219278.0, + "step": 3980 + }, + { + "epoch": 9.591430295715147, + "eval_entropy": 0.22938149347064202, + "eval_loss": 1.0711463689804077, + "eval_mean_token_accuracy": 0.8282721410976367, + "eval_num_tokens": 9219278.0, + "eval_runtime": 88.4978, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 3980 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.8971635425970586e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a8b1dc24f245625563d9ff26f7666b6b0b7952c9 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-40/trainer_state.json @@ -0,0 +1,76 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.09656004828002414, + "eval_steps": 20, + "global_step": 40, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3980456012292096.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5572511bea1989f5cb896b94b70fabb6a0ae3fa0 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-400/trainer_state.json @@ -0,0 +1,454 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.9656004828002414, + "eval_steps": 20, + "global_step": 400, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.928464556742246e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..825df727d6aab3debeb0074036a1c5191c68132c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4000/trainer_state.json @@ -0,0 +1,4234 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.63971031985516, + "eval_steps": 20, + "global_step": 4000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + }, + { + "entropy": 0.08905019680969417, + "epoch": 9.3983101991551, + "grad_norm": 0.21842406690120697, + "learning_rate": 4.177449088611095e-06, + "loss": 0.06666865348815917, + "mean_token_accuracy": 0.9753445640206337, + "num_tokens": 9033383.0, + "step": 3900 + }, + { + "epoch": 9.3983101991551, + "eval_entropy": 0.2295504841911659, + "eval_loss": 1.0662461519241333, + "eval_mean_token_accuracy": 0.8284122297603093, + "eval_num_tokens": 9033383.0, + "eval_runtime": 88.5525, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.01, + "step": 3900 + }, + { + "entropy": 0.08582521872594953, + "epoch": 9.446590223295111, + "grad_norm": 0.2000240683555603, + "learning_rate": 3.540256122150088e-06, + "loss": 0.06327944993972778, + "mean_token_accuracy": 0.9765432856976985, + "num_tokens": 9079672.0, + "step": 3920 + }, + { + "epoch": 9.446590223295111, + "eval_entropy": 0.2297678625818049, + "eval_loss": 1.0676169395446777, + "eval_mean_token_accuracy": 0.8283703879693921, + "eval_num_tokens": 9079672.0, + "eval_runtime": 87.6897, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 3920 + }, + { + "entropy": 0.09261773955076932, + "epoch": 9.494870247435124, + "grad_norm": 0.19104281067848206, + "learning_rate": 2.955303652656991e-06, + "loss": 0.06111966967582703, + "mean_token_accuracy": 0.9738784030079841, + "num_tokens": 9127647.0, + "step": 3940 + }, + { + "epoch": 9.494870247435124, + "eval_entropy": 0.22986975881490815, + "eval_loss": 1.0687925815582275, + "eval_mean_token_accuracy": 0.8282996858103892, + "eval_num_tokens": 9127647.0, + "eval_runtime": 88.2224, + "eval_samples_per_second": 16.096, + "eval_steps_per_second": 2.018, + "step": 3940 + }, + { + "entropy": 0.08347254800610245, + "epoch": 9.543150271575136, + "grad_norm": 0.18671369552612305, + "learning_rate": 2.422757214761356e-06, + "loss": 0.06384263038635254, + "mean_token_accuracy": 0.9770128890872002, + "num_tokens": 9172587.0, + "step": 3960 + }, + { + "epoch": 9.543150271575136, + "eval_entropy": 0.22975517851248217, + "eval_loss": 1.0701013803482056, + "eval_mean_token_accuracy": 0.8282244285840666, + "eval_num_tokens": 9172587.0, + "eval_runtime": 88.5794, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 3960 + }, + { + "entropy": 0.08136763009242713, + "epoch": 9.591430295715147, + "grad_norm": 0.24811454117298126, + "learning_rate": 1.942767512805673e-06, + "loss": 0.06044899821281433, + "mean_token_accuracy": 0.9776685133576393, + "num_tokens": 9219278.0, + "step": 3980 + }, + { + "epoch": 9.591430295715147, + "eval_entropy": 0.22938149347064202, + "eval_loss": 1.0711463689804077, + "eval_mean_token_accuracy": 0.8282721410976367, + "eval_num_tokens": 9219278.0, + "eval_runtime": 88.4978, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 3980 + }, + { + "entropy": 0.09432941288687288, + "epoch": 9.63971031985516, + "grad_norm": 0.30733999609947205, + "learning_rate": 1.515470378197889e-06, + "loss": 0.0672213613986969, + "mean_token_accuracy": 0.9728612303733826, + "num_tokens": 9262346.0, + "step": 4000 + }, + { + "epoch": 9.63971031985516, + "eval_entropy": 0.22936245958121976, + "eval_loss": 1.071343183517456, + "eval_mean_token_accuracy": 0.8282827025049189, + "eval_num_tokens": 9262346.0, + "eval_runtime": 88.4428, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.013, + "step": 4000 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.915846957676462e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a4f4b226a35650c6e7d300dc20df275ce95dc778 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4020/trainer_state.json @@ -0,0 +1,4255 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.687990343995171, + "eval_steps": 20, + "global_step": 4020, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + }, + { + "entropy": 0.08905019680969417, + "epoch": 9.3983101991551, + "grad_norm": 0.21842406690120697, + "learning_rate": 4.177449088611095e-06, + "loss": 0.06666865348815917, + "mean_token_accuracy": 0.9753445640206337, + "num_tokens": 9033383.0, + "step": 3900 + }, + { + "epoch": 9.3983101991551, + "eval_entropy": 0.2295504841911659, + "eval_loss": 1.0662461519241333, + "eval_mean_token_accuracy": 0.8284122297603093, + "eval_num_tokens": 9033383.0, + "eval_runtime": 88.5525, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.01, + "step": 3900 + }, + { + "entropy": 0.08582521872594953, + "epoch": 9.446590223295111, + "grad_norm": 0.2000240683555603, + "learning_rate": 3.540256122150088e-06, + "loss": 0.06327944993972778, + "mean_token_accuracy": 0.9765432856976985, + "num_tokens": 9079672.0, + "step": 3920 + }, + { + "epoch": 9.446590223295111, + "eval_entropy": 0.2297678625818049, + "eval_loss": 1.0676169395446777, + "eval_mean_token_accuracy": 0.8283703879693921, + "eval_num_tokens": 9079672.0, + "eval_runtime": 87.6897, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 3920 + }, + { + "entropy": 0.09261773955076932, + "epoch": 9.494870247435124, + "grad_norm": 0.19104281067848206, + "learning_rate": 2.955303652656991e-06, + "loss": 0.06111966967582703, + "mean_token_accuracy": 0.9738784030079841, + "num_tokens": 9127647.0, + "step": 3940 + }, + { + "epoch": 9.494870247435124, + "eval_entropy": 0.22986975881490815, + "eval_loss": 1.0687925815582275, + "eval_mean_token_accuracy": 0.8282996858103892, + "eval_num_tokens": 9127647.0, + "eval_runtime": 88.2224, + "eval_samples_per_second": 16.096, + "eval_steps_per_second": 2.018, + "step": 3940 + }, + { + "entropy": 0.08347254800610245, + "epoch": 9.543150271575136, + "grad_norm": 0.18671369552612305, + "learning_rate": 2.422757214761356e-06, + "loss": 0.06384263038635254, + "mean_token_accuracy": 0.9770128890872002, + "num_tokens": 9172587.0, + "step": 3960 + }, + { + "epoch": 9.543150271575136, + "eval_entropy": 0.22975517851248217, + "eval_loss": 1.0701013803482056, + "eval_mean_token_accuracy": 0.8282244285840666, + "eval_num_tokens": 9172587.0, + "eval_runtime": 88.5794, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 3960 + }, + { + "entropy": 0.08136763009242713, + "epoch": 9.591430295715147, + "grad_norm": 0.24811454117298126, + "learning_rate": 1.942767512805673e-06, + "loss": 0.06044899821281433, + "mean_token_accuracy": 0.9776685133576393, + "num_tokens": 9219278.0, + "step": 3980 + }, + { + "epoch": 9.591430295715147, + "eval_entropy": 0.22938149347064202, + "eval_loss": 1.0711463689804077, + "eval_mean_token_accuracy": 0.8282721410976367, + "eval_num_tokens": 9219278.0, + "eval_runtime": 88.4978, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 3980 + }, + { + "entropy": 0.09432941288687288, + "epoch": 9.63971031985516, + "grad_norm": 0.30733999609947205, + "learning_rate": 1.515470378197889e-06, + "loss": 0.0672213613986969, + "mean_token_accuracy": 0.9728612303733826, + "num_tokens": 9262346.0, + "step": 4000 + }, + { + "epoch": 9.63971031985516, + "eval_entropy": 0.22936245958121976, + "eval_loss": 1.071343183517456, + "eval_mean_token_accuracy": 0.8282827025049189, + "eval_num_tokens": 9262346.0, + "eval_runtime": 88.4428, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.013, + "step": 4000 + }, + { + "entropy": 0.08287148931995034, + "epoch": 9.687990343995171, + "grad_norm": 0.1976361870765686, + "learning_rate": 1.1409867309726256e-06, + "loss": 0.06318551301956177, + "mean_token_accuracy": 0.9770804084837437, + "num_tokens": 9309622.0, + "step": 4020 + }, + { + "epoch": 9.687990343995171, + "eval_entropy": 0.22929051920269314, + "eval_loss": 1.0711324214935303, + "eval_mean_token_accuracy": 0.8281597297513084, + "eval_num_tokens": 9309622.0, + "eval_runtime": 88.5243, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 4020 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.93548827168383e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8494e1b2ab0ec89735e84590edb1a22a03f1e9d0 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4040/trainer_state.json @@ -0,0 +1,4276 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.736270368135184, + "eval_steps": 20, + "global_step": 4040, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + }, + { + "entropy": 0.08905019680969417, + "epoch": 9.3983101991551, + "grad_norm": 0.21842406690120697, + "learning_rate": 4.177449088611095e-06, + "loss": 0.06666865348815917, + "mean_token_accuracy": 0.9753445640206337, + "num_tokens": 9033383.0, + "step": 3900 + }, + { + "epoch": 9.3983101991551, + "eval_entropy": 0.2295504841911659, + "eval_loss": 1.0662461519241333, + "eval_mean_token_accuracy": 0.8284122297603093, + "eval_num_tokens": 9033383.0, + "eval_runtime": 88.5525, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.01, + "step": 3900 + }, + { + "entropy": 0.08582521872594953, + "epoch": 9.446590223295111, + "grad_norm": 0.2000240683555603, + "learning_rate": 3.540256122150088e-06, + "loss": 0.06327944993972778, + "mean_token_accuracy": 0.9765432856976985, + "num_tokens": 9079672.0, + "step": 3920 + }, + { + "epoch": 9.446590223295111, + "eval_entropy": 0.2297678625818049, + "eval_loss": 1.0676169395446777, + "eval_mean_token_accuracy": 0.8283703879693921, + "eval_num_tokens": 9079672.0, + "eval_runtime": 87.6897, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 3920 + }, + { + "entropy": 0.09261773955076932, + "epoch": 9.494870247435124, + "grad_norm": 0.19104281067848206, + "learning_rate": 2.955303652656991e-06, + "loss": 0.06111966967582703, + "mean_token_accuracy": 0.9738784030079841, + "num_tokens": 9127647.0, + "step": 3940 + }, + { + "epoch": 9.494870247435124, + "eval_entropy": 0.22986975881490815, + "eval_loss": 1.0687925815582275, + "eval_mean_token_accuracy": 0.8282996858103892, + "eval_num_tokens": 9127647.0, + "eval_runtime": 88.2224, + "eval_samples_per_second": 16.096, + "eval_steps_per_second": 2.018, + "step": 3940 + }, + { + "entropy": 0.08347254800610245, + "epoch": 9.543150271575136, + "grad_norm": 0.18671369552612305, + "learning_rate": 2.422757214761356e-06, + "loss": 0.06384263038635254, + "mean_token_accuracy": 0.9770128890872002, + "num_tokens": 9172587.0, + "step": 3960 + }, + { + "epoch": 9.543150271575136, + "eval_entropy": 0.22975517851248217, + "eval_loss": 1.0701013803482056, + "eval_mean_token_accuracy": 0.8282244285840666, + "eval_num_tokens": 9172587.0, + "eval_runtime": 88.5794, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 3960 + }, + { + "entropy": 0.08136763009242713, + "epoch": 9.591430295715147, + "grad_norm": 0.24811454117298126, + "learning_rate": 1.942767512805673e-06, + "loss": 0.06044899821281433, + "mean_token_accuracy": 0.9776685133576393, + "num_tokens": 9219278.0, + "step": 3980 + }, + { + "epoch": 9.591430295715147, + "eval_entropy": 0.22938149347064202, + "eval_loss": 1.0711463689804077, + "eval_mean_token_accuracy": 0.8282721410976367, + "eval_num_tokens": 9219278.0, + "eval_runtime": 88.4978, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 3980 + }, + { + "entropy": 0.09432941288687288, + "epoch": 9.63971031985516, + "grad_norm": 0.30733999609947205, + "learning_rate": 1.515470378197889e-06, + "loss": 0.0672213613986969, + "mean_token_accuracy": 0.9728612303733826, + "num_tokens": 9262346.0, + "step": 4000 + }, + { + "epoch": 9.63971031985516, + "eval_entropy": 0.22936245958121976, + "eval_loss": 1.071343183517456, + "eval_mean_token_accuracy": 0.8282827025049189, + "eval_num_tokens": 9262346.0, + "eval_runtime": 88.4428, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.013, + "step": 4000 + }, + { + "entropy": 0.08287148931995034, + "epoch": 9.687990343995171, + "grad_norm": 0.1976361870765686, + "learning_rate": 1.1409867309726256e-06, + "loss": 0.06318551301956177, + "mean_token_accuracy": 0.9770804084837437, + "num_tokens": 9309622.0, + "step": 4020 + }, + { + "epoch": 9.687990343995171, + "eval_entropy": 0.22929051920269314, + "eval_loss": 1.0711324214935303, + "eval_mean_token_accuracy": 0.8281597297513084, + "eval_num_tokens": 9309622.0, + "eval_runtime": 88.5243, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 4020 + }, + { + "entropy": 0.0907150611979887, + "epoch": 9.736270368135184, + "grad_norm": 0.16192017495632172, + "learning_rate": 8.194225455723828e-07, + "loss": 0.06589602828025817, + "mean_token_accuracy": 0.9738550461828709, + "num_tokens": 9354549.0, + "step": 4040 + }, + { + "epoch": 9.736270368135184, + "eval_entropy": 0.22913936391640244, + "eval_loss": 1.0715173482894897, + "eval_mean_token_accuracy": 0.8281301544623428, + "eval_num_tokens": 9354549.0, + "eval_runtime": 88.875, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 2.003, + "step": 4040 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.9548795845973606e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..45b45b5ca7473bdc57fcfdfbdbd9005c4b3b191f --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4060/trainer_state.json @@ -0,0 +1,4297 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.784550392275197, + "eval_steps": 20, + "global_step": 4060, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + }, + { + "entropy": 0.08905019680969417, + "epoch": 9.3983101991551, + "grad_norm": 0.21842406690120697, + "learning_rate": 4.177449088611095e-06, + "loss": 0.06666865348815917, + "mean_token_accuracy": 0.9753445640206337, + "num_tokens": 9033383.0, + "step": 3900 + }, + { + "epoch": 9.3983101991551, + "eval_entropy": 0.2295504841911659, + "eval_loss": 1.0662461519241333, + "eval_mean_token_accuracy": 0.8284122297603093, + "eval_num_tokens": 9033383.0, + "eval_runtime": 88.5525, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.01, + "step": 3900 + }, + { + "entropy": 0.08582521872594953, + "epoch": 9.446590223295111, + "grad_norm": 0.2000240683555603, + "learning_rate": 3.540256122150088e-06, + "loss": 0.06327944993972778, + "mean_token_accuracy": 0.9765432856976985, + "num_tokens": 9079672.0, + "step": 3920 + }, + { + "epoch": 9.446590223295111, + "eval_entropy": 0.2297678625818049, + "eval_loss": 1.0676169395446777, + "eval_mean_token_accuracy": 0.8283703879693921, + "eval_num_tokens": 9079672.0, + "eval_runtime": 87.6897, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 3920 + }, + { + "entropy": 0.09261773955076932, + "epoch": 9.494870247435124, + "grad_norm": 0.19104281067848206, + "learning_rate": 2.955303652656991e-06, + "loss": 0.06111966967582703, + "mean_token_accuracy": 0.9738784030079841, + "num_tokens": 9127647.0, + "step": 3940 + }, + { + "epoch": 9.494870247435124, + "eval_entropy": 0.22986975881490815, + "eval_loss": 1.0687925815582275, + "eval_mean_token_accuracy": 0.8282996858103892, + "eval_num_tokens": 9127647.0, + "eval_runtime": 88.2224, + "eval_samples_per_second": 16.096, + "eval_steps_per_second": 2.018, + "step": 3940 + }, + { + "entropy": 0.08347254800610245, + "epoch": 9.543150271575136, + "grad_norm": 0.18671369552612305, + "learning_rate": 2.422757214761356e-06, + "loss": 0.06384263038635254, + "mean_token_accuracy": 0.9770128890872002, + "num_tokens": 9172587.0, + "step": 3960 + }, + { + "epoch": 9.543150271575136, + "eval_entropy": 0.22975517851248217, + "eval_loss": 1.0701013803482056, + "eval_mean_token_accuracy": 0.8282244285840666, + "eval_num_tokens": 9172587.0, + "eval_runtime": 88.5794, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 3960 + }, + { + "entropy": 0.08136763009242713, + "epoch": 9.591430295715147, + "grad_norm": 0.24811454117298126, + "learning_rate": 1.942767512805673e-06, + "loss": 0.06044899821281433, + "mean_token_accuracy": 0.9776685133576393, + "num_tokens": 9219278.0, + "step": 3980 + }, + { + "epoch": 9.591430295715147, + "eval_entropy": 0.22938149347064202, + "eval_loss": 1.0711463689804077, + "eval_mean_token_accuracy": 0.8282721410976367, + "eval_num_tokens": 9219278.0, + "eval_runtime": 88.4978, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 3980 + }, + { + "entropy": 0.09432941288687288, + "epoch": 9.63971031985516, + "grad_norm": 0.30733999609947205, + "learning_rate": 1.515470378197889e-06, + "loss": 0.0672213613986969, + "mean_token_accuracy": 0.9728612303733826, + "num_tokens": 9262346.0, + "step": 4000 + }, + { + "epoch": 9.63971031985516, + "eval_entropy": 0.22936245958121976, + "eval_loss": 1.071343183517456, + "eval_mean_token_accuracy": 0.8282827025049189, + "eval_num_tokens": 9262346.0, + "eval_runtime": 88.4428, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.013, + "step": 4000 + }, + { + "entropy": 0.08287148931995034, + "epoch": 9.687990343995171, + "grad_norm": 0.1976361870765686, + "learning_rate": 1.1409867309726256e-06, + "loss": 0.06318551301956177, + "mean_token_accuracy": 0.9770804084837437, + "num_tokens": 9309622.0, + "step": 4020 + }, + { + "epoch": 9.687990343995171, + "eval_entropy": 0.22929051920269314, + "eval_loss": 1.0711324214935303, + "eval_mean_token_accuracy": 0.8281597297513084, + "eval_num_tokens": 9309622.0, + "eval_runtime": 88.5243, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 4020 + }, + { + "entropy": 0.0907150611979887, + "epoch": 9.736270368135184, + "grad_norm": 0.16192017495632172, + "learning_rate": 8.194225455723828e-07, + "loss": 0.06589602828025817, + "mean_token_accuracy": 0.9738550461828709, + "num_tokens": 9354549.0, + "step": 4040 + }, + { + "epoch": 9.736270368135184, + "eval_entropy": 0.22913936391640244, + "eval_loss": 1.0715173482894897, + "eval_mean_token_accuracy": 0.8281301544623428, + "eval_num_tokens": 9354549.0, + "eval_runtime": 88.875, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 2.003, + "step": 4040 + }, + { + "entropy": 0.09003224167972804, + "epoch": 9.784550392275197, + "grad_norm": 0.2092711478471756, + "learning_rate": 5.508688208578523e-07, + "loss": 0.06655729413032532, + "mean_token_accuracy": 0.9750426560640335, + "num_tokens": 9399394.0, + "step": 4060 + }, + { + "epoch": 9.784550392275197, + "eval_entropy": 0.2291239777140403, + "eval_loss": 1.0715563297271729, + "eval_mean_token_accuracy": 0.8281808595978812, + "eval_num_tokens": 9399394.0, + "eval_runtime": 88.4328, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 4060 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.9741849322224845e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..58147bdf060a374b5723e250d839deedcd64b1c2 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4080/trainer_state.json @@ -0,0 +1,4318 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.832830416415208, + "eval_steps": 20, + "global_step": 4080, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + }, + { + "entropy": 0.08905019680969417, + "epoch": 9.3983101991551, + "grad_norm": 0.21842406690120697, + "learning_rate": 4.177449088611095e-06, + "loss": 0.06666865348815917, + "mean_token_accuracy": 0.9753445640206337, + "num_tokens": 9033383.0, + "step": 3900 + }, + { + "epoch": 9.3983101991551, + "eval_entropy": 0.2295504841911659, + "eval_loss": 1.0662461519241333, + "eval_mean_token_accuracy": 0.8284122297603093, + "eval_num_tokens": 9033383.0, + "eval_runtime": 88.5525, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.01, + "step": 3900 + }, + { + "entropy": 0.08582521872594953, + "epoch": 9.446590223295111, + "grad_norm": 0.2000240683555603, + "learning_rate": 3.540256122150088e-06, + "loss": 0.06327944993972778, + "mean_token_accuracy": 0.9765432856976985, + "num_tokens": 9079672.0, + "step": 3920 + }, + { + "epoch": 9.446590223295111, + "eval_entropy": 0.2297678625818049, + "eval_loss": 1.0676169395446777, + "eval_mean_token_accuracy": 0.8283703879693921, + "eval_num_tokens": 9079672.0, + "eval_runtime": 87.6897, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 3920 + }, + { + "entropy": 0.09261773955076932, + "epoch": 9.494870247435124, + "grad_norm": 0.19104281067848206, + "learning_rate": 2.955303652656991e-06, + "loss": 0.06111966967582703, + "mean_token_accuracy": 0.9738784030079841, + "num_tokens": 9127647.0, + "step": 3940 + }, + { + "epoch": 9.494870247435124, + "eval_entropy": 0.22986975881490815, + "eval_loss": 1.0687925815582275, + "eval_mean_token_accuracy": 0.8282996858103892, + "eval_num_tokens": 9127647.0, + "eval_runtime": 88.2224, + "eval_samples_per_second": 16.096, + "eval_steps_per_second": 2.018, + "step": 3940 + }, + { + "entropy": 0.08347254800610245, + "epoch": 9.543150271575136, + "grad_norm": 0.18671369552612305, + "learning_rate": 2.422757214761356e-06, + "loss": 0.06384263038635254, + "mean_token_accuracy": 0.9770128890872002, + "num_tokens": 9172587.0, + "step": 3960 + }, + { + "epoch": 9.543150271575136, + "eval_entropy": 0.22975517851248217, + "eval_loss": 1.0701013803482056, + "eval_mean_token_accuracy": 0.8282244285840666, + "eval_num_tokens": 9172587.0, + "eval_runtime": 88.5794, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 3960 + }, + { + "entropy": 0.08136763009242713, + "epoch": 9.591430295715147, + "grad_norm": 0.24811454117298126, + "learning_rate": 1.942767512805673e-06, + "loss": 0.06044899821281433, + "mean_token_accuracy": 0.9776685133576393, + "num_tokens": 9219278.0, + "step": 3980 + }, + { + "epoch": 9.591430295715147, + "eval_entropy": 0.22938149347064202, + "eval_loss": 1.0711463689804077, + "eval_mean_token_accuracy": 0.8282721410976367, + "eval_num_tokens": 9219278.0, + "eval_runtime": 88.4978, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 3980 + }, + { + "entropy": 0.09432941288687288, + "epoch": 9.63971031985516, + "grad_norm": 0.30733999609947205, + "learning_rate": 1.515470378197889e-06, + "loss": 0.0672213613986969, + "mean_token_accuracy": 0.9728612303733826, + "num_tokens": 9262346.0, + "step": 4000 + }, + { + "epoch": 9.63971031985516, + "eval_entropy": 0.22936245958121976, + "eval_loss": 1.071343183517456, + "eval_mean_token_accuracy": 0.8282827025049189, + "eval_num_tokens": 9262346.0, + "eval_runtime": 88.4428, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.013, + "step": 4000 + }, + { + "entropy": 0.08287148931995034, + "epoch": 9.687990343995171, + "grad_norm": 0.1976361870765686, + "learning_rate": 1.1409867309726256e-06, + "loss": 0.06318551301956177, + "mean_token_accuracy": 0.9770804084837437, + "num_tokens": 9309622.0, + "step": 4020 + }, + { + "epoch": 9.687990343995171, + "eval_entropy": 0.22929051920269314, + "eval_loss": 1.0711324214935303, + "eval_mean_token_accuracy": 0.8281597297513084, + "eval_num_tokens": 9309622.0, + "eval_runtime": 88.5243, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 4020 + }, + { + "entropy": 0.0907150611979887, + "epoch": 9.736270368135184, + "grad_norm": 0.16192017495632172, + "learning_rate": 8.194225455723828e-07, + "loss": 0.06589602828025817, + "mean_token_accuracy": 0.9738550461828709, + "num_tokens": 9354549.0, + "step": 4040 + }, + { + "epoch": 9.736270368135184, + "eval_entropy": 0.22913936391640244, + "eval_loss": 1.0715173482894897, + "eval_mean_token_accuracy": 0.8281301544623428, + "eval_num_tokens": 9354549.0, + "eval_runtime": 88.875, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 2.003, + "step": 4040 + }, + { + "entropy": 0.09003224167972804, + "epoch": 9.784550392275197, + "grad_norm": 0.2092711478471756, + "learning_rate": 5.508688208578523e-07, + "loss": 0.06655729413032532, + "mean_token_accuracy": 0.9750426560640335, + "num_tokens": 9399394.0, + "step": 4060 + }, + { + "epoch": 9.784550392275197, + "eval_entropy": 0.2291239777140403, + "eval_loss": 1.0715563297271729, + "eval_mean_token_accuracy": 0.8281808595978812, + "eval_num_tokens": 9399394.0, + "eval_runtime": 88.4328, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 4060 + }, + { + "entropy": 0.08719871481880545, + "epoch": 9.832830416415208, + "grad_norm": 0.17966455221176147, + "learning_rate": 3.3540155435645076e-07, + "loss": 0.05917760729789734, + "mean_token_accuracy": 0.9752349570393563, + "num_tokens": 9449483.0, + "step": 4080 + }, + { + "epoch": 9.832830416415208, + "eval_entropy": 0.2291418021816886, + "eval_loss": 1.0714553594589233, + "eval_mean_token_accuracy": 0.8281870403986299, + "eval_num_tokens": 9449483.0, + "eval_runtime": 88.2612, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 4080 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.996149940607304e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d174b19caf00a3dc8026cf81a3cf34f38ee46ad5 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4100/trainer_state.json @@ -0,0 +1,4339 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.88111044055522, + "eval_steps": 20, + "global_step": 4100, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + }, + { + "entropy": 0.08905019680969417, + "epoch": 9.3983101991551, + "grad_norm": 0.21842406690120697, + "learning_rate": 4.177449088611095e-06, + "loss": 0.06666865348815917, + "mean_token_accuracy": 0.9753445640206337, + "num_tokens": 9033383.0, + "step": 3900 + }, + { + "epoch": 9.3983101991551, + "eval_entropy": 0.2295504841911659, + "eval_loss": 1.0662461519241333, + "eval_mean_token_accuracy": 0.8284122297603093, + "eval_num_tokens": 9033383.0, + "eval_runtime": 88.5525, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.01, + "step": 3900 + }, + { + "entropy": 0.08582521872594953, + "epoch": 9.446590223295111, + "grad_norm": 0.2000240683555603, + "learning_rate": 3.540256122150088e-06, + "loss": 0.06327944993972778, + "mean_token_accuracy": 0.9765432856976985, + "num_tokens": 9079672.0, + "step": 3920 + }, + { + "epoch": 9.446590223295111, + "eval_entropy": 0.2297678625818049, + "eval_loss": 1.0676169395446777, + "eval_mean_token_accuracy": 0.8283703879693921, + "eval_num_tokens": 9079672.0, + "eval_runtime": 87.6897, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 3920 + }, + { + "entropy": 0.09261773955076932, + "epoch": 9.494870247435124, + "grad_norm": 0.19104281067848206, + "learning_rate": 2.955303652656991e-06, + "loss": 0.06111966967582703, + "mean_token_accuracy": 0.9738784030079841, + "num_tokens": 9127647.0, + "step": 3940 + }, + { + "epoch": 9.494870247435124, + "eval_entropy": 0.22986975881490815, + "eval_loss": 1.0687925815582275, + "eval_mean_token_accuracy": 0.8282996858103892, + "eval_num_tokens": 9127647.0, + "eval_runtime": 88.2224, + "eval_samples_per_second": 16.096, + "eval_steps_per_second": 2.018, + "step": 3940 + }, + { + "entropy": 0.08347254800610245, + "epoch": 9.543150271575136, + "grad_norm": 0.18671369552612305, + "learning_rate": 2.422757214761356e-06, + "loss": 0.06384263038635254, + "mean_token_accuracy": 0.9770128890872002, + "num_tokens": 9172587.0, + "step": 3960 + }, + { + "epoch": 9.543150271575136, + "eval_entropy": 0.22975517851248217, + "eval_loss": 1.0701013803482056, + "eval_mean_token_accuracy": 0.8282244285840666, + "eval_num_tokens": 9172587.0, + "eval_runtime": 88.5794, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 3960 + }, + { + "entropy": 0.08136763009242713, + "epoch": 9.591430295715147, + "grad_norm": 0.24811454117298126, + "learning_rate": 1.942767512805673e-06, + "loss": 0.06044899821281433, + "mean_token_accuracy": 0.9776685133576393, + "num_tokens": 9219278.0, + "step": 3980 + }, + { + "epoch": 9.591430295715147, + "eval_entropy": 0.22938149347064202, + "eval_loss": 1.0711463689804077, + "eval_mean_token_accuracy": 0.8282721410976367, + "eval_num_tokens": 9219278.0, + "eval_runtime": 88.4978, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 3980 + }, + { + "entropy": 0.09432941288687288, + "epoch": 9.63971031985516, + "grad_norm": 0.30733999609947205, + "learning_rate": 1.515470378197889e-06, + "loss": 0.0672213613986969, + "mean_token_accuracy": 0.9728612303733826, + "num_tokens": 9262346.0, + "step": 4000 + }, + { + "epoch": 9.63971031985516, + "eval_entropy": 0.22936245958121976, + "eval_loss": 1.071343183517456, + "eval_mean_token_accuracy": 0.8282827025049189, + "eval_num_tokens": 9262346.0, + "eval_runtime": 88.4428, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.013, + "step": 4000 + }, + { + "entropy": 0.08287148931995034, + "epoch": 9.687990343995171, + "grad_norm": 0.1976361870765686, + "learning_rate": 1.1409867309726256e-06, + "loss": 0.06318551301956177, + "mean_token_accuracy": 0.9770804084837437, + "num_tokens": 9309622.0, + "step": 4020 + }, + { + "epoch": 9.687990343995171, + "eval_entropy": 0.22929051920269314, + "eval_loss": 1.0711324214935303, + "eval_mean_token_accuracy": 0.8281597297513084, + "eval_num_tokens": 9309622.0, + "eval_runtime": 88.5243, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 4020 + }, + { + "entropy": 0.0907150611979887, + "epoch": 9.736270368135184, + "grad_norm": 0.16192017495632172, + "learning_rate": 8.194225455723828e-07, + "loss": 0.06589602828025817, + "mean_token_accuracy": 0.9738550461828709, + "num_tokens": 9354549.0, + "step": 4040 + }, + { + "epoch": 9.736270368135184, + "eval_entropy": 0.22913936391640244, + "eval_loss": 1.0715173482894897, + "eval_mean_token_accuracy": 0.8281301544623428, + "eval_num_tokens": 9354549.0, + "eval_runtime": 88.875, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 2.003, + "step": 4040 + }, + { + "entropy": 0.09003224167972804, + "epoch": 9.784550392275197, + "grad_norm": 0.2092711478471756, + "learning_rate": 5.508688208578523e-07, + "loss": 0.06655729413032532, + "mean_token_accuracy": 0.9750426560640335, + "num_tokens": 9399394.0, + "step": 4060 + }, + { + "epoch": 9.784550392275197, + "eval_entropy": 0.2291239777140403, + "eval_loss": 1.0715563297271729, + "eval_mean_token_accuracy": 0.8281808595978812, + "eval_num_tokens": 9399394.0, + "eval_runtime": 88.4328, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 4060 + }, + { + "entropy": 0.08719871481880545, + "epoch": 9.832830416415208, + "grad_norm": 0.17966455221176147, + "learning_rate": 3.3540155435645076e-07, + "loss": 0.05917760729789734, + "mean_token_accuracy": 0.9752349570393563, + "num_tokens": 9449483.0, + "step": 4080 + }, + { + "epoch": 9.832830416415208, + "eval_entropy": 0.2291418021816886, + "eval_loss": 1.0714553594589233, + "eval_mean_token_accuracy": 0.8281870403986299, + "eval_num_tokens": 9449483.0, + "eval_runtime": 88.2612, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 4080 + }, + { + "entropy": 0.07887464743107557, + "epoch": 9.88111044055522, + "grad_norm": 0.4397202134132385, + "learning_rate": 1.7308172075587924e-07, + "loss": 0.060457843542099, + "mean_token_accuracy": 0.9779011741280556, + "num_tokens": 9497731.0, + "step": 4100 + }, + { + "epoch": 9.88111044055522, + "eval_entropy": 0.2292038949855258, + "eval_loss": 1.0717124938964844, + "eval_mean_token_accuracy": 0.8282261353530241, + "eval_num_tokens": 9497731.0, + "eval_runtime": 88.5793, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 4100 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.016731609606226e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..3a166eca37890dcd8d5c06784b45779bbdb0fb67 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4120/trainer_state.json @@ -0,0 +1,4360 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.929390464695233, + "eval_steps": 20, + "global_step": 4120, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + }, + { + "entropy": 0.08905019680969417, + "epoch": 9.3983101991551, + "grad_norm": 0.21842406690120697, + "learning_rate": 4.177449088611095e-06, + "loss": 0.06666865348815917, + "mean_token_accuracy": 0.9753445640206337, + "num_tokens": 9033383.0, + "step": 3900 + }, + { + "epoch": 9.3983101991551, + "eval_entropy": 0.2295504841911659, + "eval_loss": 1.0662461519241333, + "eval_mean_token_accuracy": 0.8284122297603093, + "eval_num_tokens": 9033383.0, + "eval_runtime": 88.5525, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.01, + "step": 3900 + }, + { + "entropy": 0.08582521872594953, + "epoch": 9.446590223295111, + "grad_norm": 0.2000240683555603, + "learning_rate": 3.540256122150088e-06, + "loss": 0.06327944993972778, + "mean_token_accuracy": 0.9765432856976985, + "num_tokens": 9079672.0, + "step": 3920 + }, + { + "epoch": 9.446590223295111, + "eval_entropy": 0.2297678625818049, + "eval_loss": 1.0676169395446777, + "eval_mean_token_accuracy": 0.8283703879693921, + "eval_num_tokens": 9079672.0, + "eval_runtime": 87.6897, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 3920 + }, + { + "entropy": 0.09261773955076932, + "epoch": 9.494870247435124, + "grad_norm": 0.19104281067848206, + "learning_rate": 2.955303652656991e-06, + "loss": 0.06111966967582703, + "mean_token_accuracy": 0.9738784030079841, + "num_tokens": 9127647.0, + "step": 3940 + }, + { + "epoch": 9.494870247435124, + "eval_entropy": 0.22986975881490815, + "eval_loss": 1.0687925815582275, + "eval_mean_token_accuracy": 0.8282996858103892, + "eval_num_tokens": 9127647.0, + "eval_runtime": 88.2224, + "eval_samples_per_second": 16.096, + "eval_steps_per_second": 2.018, + "step": 3940 + }, + { + "entropy": 0.08347254800610245, + "epoch": 9.543150271575136, + "grad_norm": 0.18671369552612305, + "learning_rate": 2.422757214761356e-06, + "loss": 0.06384263038635254, + "mean_token_accuracy": 0.9770128890872002, + "num_tokens": 9172587.0, + "step": 3960 + }, + { + "epoch": 9.543150271575136, + "eval_entropy": 0.22975517851248217, + "eval_loss": 1.0701013803482056, + "eval_mean_token_accuracy": 0.8282244285840666, + "eval_num_tokens": 9172587.0, + "eval_runtime": 88.5794, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 3960 + }, + { + "entropy": 0.08136763009242713, + "epoch": 9.591430295715147, + "grad_norm": 0.24811454117298126, + "learning_rate": 1.942767512805673e-06, + "loss": 0.06044899821281433, + "mean_token_accuracy": 0.9776685133576393, + "num_tokens": 9219278.0, + "step": 3980 + }, + { + "epoch": 9.591430295715147, + "eval_entropy": 0.22938149347064202, + "eval_loss": 1.0711463689804077, + "eval_mean_token_accuracy": 0.8282721410976367, + "eval_num_tokens": 9219278.0, + "eval_runtime": 88.4978, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 3980 + }, + { + "entropy": 0.09432941288687288, + "epoch": 9.63971031985516, + "grad_norm": 0.30733999609947205, + "learning_rate": 1.515470378197889e-06, + "loss": 0.0672213613986969, + "mean_token_accuracy": 0.9728612303733826, + "num_tokens": 9262346.0, + "step": 4000 + }, + { + "epoch": 9.63971031985516, + "eval_entropy": 0.22936245958121976, + "eval_loss": 1.071343183517456, + "eval_mean_token_accuracy": 0.8282827025049189, + "eval_num_tokens": 9262346.0, + "eval_runtime": 88.4428, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.013, + "step": 4000 + }, + { + "entropy": 0.08287148931995034, + "epoch": 9.687990343995171, + "grad_norm": 0.1976361870765686, + "learning_rate": 1.1409867309726256e-06, + "loss": 0.06318551301956177, + "mean_token_accuracy": 0.9770804084837437, + "num_tokens": 9309622.0, + "step": 4020 + }, + { + "epoch": 9.687990343995171, + "eval_entropy": 0.22929051920269314, + "eval_loss": 1.0711324214935303, + "eval_mean_token_accuracy": 0.8281597297513084, + "eval_num_tokens": 9309622.0, + "eval_runtime": 88.5243, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 4020 + }, + { + "entropy": 0.0907150611979887, + "epoch": 9.736270368135184, + "grad_norm": 0.16192017495632172, + "learning_rate": 8.194225455723828e-07, + "loss": 0.06589602828025817, + "mean_token_accuracy": 0.9738550461828709, + "num_tokens": 9354549.0, + "step": 4040 + }, + { + "epoch": 9.736270368135184, + "eval_entropy": 0.22913936391640244, + "eval_loss": 1.0715173482894897, + "eval_mean_token_accuracy": 0.8281301544623428, + "eval_num_tokens": 9354549.0, + "eval_runtime": 88.875, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 2.003, + "step": 4040 + }, + { + "entropy": 0.09003224167972804, + "epoch": 9.784550392275197, + "grad_norm": 0.2092711478471756, + "learning_rate": 5.508688208578523e-07, + "loss": 0.06655729413032532, + "mean_token_accuracy": 0.9750426560640335, + "num_tokens": 9399394.0, + "step": 4060 + }, + { + "epoch": 9.784550392275197, + "eval_entropy": 0.2291239777140403, + "eval_loss": 1.0715563297271729, + "eval_mean_token_accuracy": 0.8281808595978812, + "eval_num_tokens": 9399394.0, + "eval_runtime": 88.4328, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 4060 + }, + { + "entropy": 0.08719871481880545, + "epoch": 9.832830416415208, + "grad_norm": 0.17966455221176147, + "learning_rate": 3.3540155435645076e-07, + "loss": 0.05917760729789734, + "mean_token_accuracy": 0.9752349570393563, + "num_tokens": 9449483.0, + "step": 4080 + }, + { + "epoch": 9.832830416415208, + "eval_entropy": 0.2291418021816886, + "eval_loss": 1.0714553594589233, + "eval_mean_token_accuracy": 0.8281870403986299, + "eval_num_tokens": 9449483.0, + "eval_runtime": 88.2612, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 4080 + }, + { + "entropy": 0.07887464743107557, + "epoch": 9.88111044055522, + "grad_norm": 0.4397202134132385, + "learning_rate": 1.7308172075587924e-07, + "loss": 0.060457843542099, + "mean_token_accuracy": 0.9779011741280556, + "num_tokens": 9497731.0, + "step": 4100 + }, + { + "epoch": 9.88111044055522, + "eval_entropy": 0.2292038949855258, + "eval_loss": 1.0717124938964844, + "eval_mean_token_accuracy": 0.8282261353530241, + "eval_num_tokens": 9497731.0, + "eval_runtime": 88.5793, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 4100 + }, + { + "entropy": 0.07985925199463964, + "epoch": 9.929390464695233, + "grad_norm": 0.2129203975200653, + "learning_rate": 6.395525464895752e-08, + "loss": 0.05666370391845703, + "mean_token_accuracy": 0.9778168581426143, + "num_tokens": 9548917.0, + "step": 4120 + }, + { + "epoch": 9.929390464695233, + "eval_entropy": 0.22915430601393239, + "eval_loss": 1.0715631246566772, + "eval_mean_token_accuracy": 0.8282323436120923, + "eval_num_tokens": 9548917.0, + "eval_runtime": 88.4991, + "eval_samples_per_second": 16.045, + "eval_steps_per_second": 2.011, + "step": 4120 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.039151005944054e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6a191bdc36f524b0aa2d0718b19c2fc6408384ea --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4140/trainer_state.json @@ -0,0 +1,4381 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 9.977670488835244, + "eval_steps": 20, + "global_step": 4140, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + }, + { + "entropy": 0.08905019680969417, + "epoch": 9.3983101991551, + "grad_norm": 0.21842406690120697, + "learning_rate": 4.177449088611095e-06, + "loss": 0.06666865348815917, + "mean_token_accuracy": 0.9753445640206337, + "num_tokens": 9033383.0, + "step": 3900 + }, + { + "epoch": 9.3983101991551, + "eval_entropy": 0.2295504841911659, + "eval_loss": 1.0662461519241333, + "eval_mean_token_accuracy": 0.8284122297603093, + "eval_num_tokens": 9033383.0, + "eval_runtime": 88.5525, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.01, + "step": 3900 + }, + { + "entropy": 0.08582521872594953, + "epoch": 9.446590223295111, + "grad_norm": 0.2000240683555603, + "learning_rate": 3.540256122150088e-06, + "loss": 0.06327944993972778, + "mean_token_accuracy": 0.9765432856976985, + "num_tokens": 9079672.0, + "step": 3920 + }, + { + "epoch": 9.446590223295111, + "eval_entropy": 0.2297678625818049, + "eval_loss": 1.0676169395446777, + "eval_mean_token_accuracy": 0.8283703879693921, + "eval_num_tokens": 9079672.0, + "eval_runtime": 87.6897, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 3920 + }, + { + "entropy": 0.09261773955076932, + "epoch": 9.494870247435124, + "grad_norm": 0.19104281067848206, + "learning_rate": 2.955303652656991e-06, + "loss": 0.06111966967582703, + "mean_token_accuracy": 0.9738784030079841, + "num_tokens": 9127647.0, + "step": 3940 + }, + { + "epoch": 9.494870247435124, + "eval_entropy": 0.22986975881490815, + "eval_loss": 1.0687925815582275, + "eval_mean_token_accuracy": 0.8282996858103892, + "eval_num_tokens": 9127647.0, + "eval_runtime": 88.2224, + "eval_samples_per_second": 16.096, + "eval_steps_per_second": 2.018, + "step": 3940 + }, + { + "entropy": 0.08347254800610245, + "epoch": 9.543150271575136, + "grad_norm": 0.18671369552612305, + "learning_rate": 2.422757214761356e-06, + "loss": 0.06384263038635254, + "mean_token_accuracy": 0.9770128890872002, + "num_tokens": 9172587.0, + "step": 3960 + }, + { + "epoch": 9.543150271575136, + "eval_entropy": 0.22975517851248217, + "eval_loss": 1.0701013803482056, + "eval_mean_token_accuracy": 0.8282244285840666, + "eval_num_tokens": 9172587.0, + "eval_runtime": 88.5794, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 3960 + }, + { + "entropy": 0.08136763009242713, + "epoch": 9.591430295715147, + "grad_norm": 0.24811454117298126, + "learning_rate": 1.942767512805673e-06, + "loss": 0.06044899821281433, + "mean_token_accuracy": 0.9776685133576393, + "num_tokens": 9219278.0, + "step": 3980 + }, + { + "epoch": 9.591430295715147, + "eval_entropy": 0.22938149347064202, + "eval_loss": 1.0711463689804077, + "eval_mean_token_accuracy": 0.8282721410976367, + "eval_num_tokens": 9219278.0, + "eval_runtime": 88.4978, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 3980 + }, + { + "entropy": 0.09432941288687288, + "epoch": 9.63971031985516, + "grad_norm": 0.30733999609947205, + "learning_rate": 1.515470378197889e-06, + "loss": 0.0672213613986969, + "mean_token_accuracy": 0.9728612303733826, + "num_tokens": 9262346.0, + "step": 4000 + }, + { + "epoch": 9.63971031985516, + "eval_entropy": 0.22936245958121976, + "eval_loss": 1.071343183517456, + "eval_mean_token_accuracy": 0.8282827025049189, + "eval_num_tokens": 9262346.0, + "eval_runtime": 88.4428, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.013, + "step": 4000 + }, + { + "entropy": 0.08287148931995034, + "epoch": 9.687990343995171, + "grad_norm": 0.1976361870765686, + "learning_rate": 1.1409867309726256e-06, + "loss": 0.06318551301956177, + "mean_token_accuracy": 0.9770804084837437, + "num_tokens": 9309622.0, + "step": 4020 + }, + { + "epoch": 9.687990343995171, + "eval_entropy": 0.22929051920269314, + "eval_loss": 1.0711324214935303, + "eval_mean_token_accuracy": 0.8281597297513084, + "eval_num_tokens": 9309622.0, + "eval_runtime": 88.5243, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 4020 + }, + { + "entropy": 0.0907150611979887, + "epoch": 9.736270368135184, + "grad_norm": 0.16192017495632172, + "learning_rate": 8.194225455723828e-07, + "loss": 0.06589602828025817, + "mean_token_accuracy": 0.9738550461828709, + "num_tokens": 9354549.0, + "step": 4040 + }, + { + "epoch": 9.736270368135184, + "eval_entropy": 0.22913936391640244, + "eval_loss": 1.0715173482894897, + "eval_mean_token_accuracy": 0.8281301544623428, + "eval_num_tokens": 9354549.0, + "eval_runtime": 88.875, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 2.003, + "step": 4040 + }, + { + "entropy": 0.09003224167972804, + "epoch": 9.784550392275197, + "grad_norm": 0.2092711478471756, + "learning_rate": 5.508688208578523e-07, + "loss": 0.06655729413032532, + "mean_token_accuracy": 0.9750426560640335, + "num_tokens": 9399394.0, + "step": 4060 + }, + { + "epoch": 9.784550392275197, + "eval_entropy": 0.2291239777140403, + "eval_loss": 1.0715563297271729, + "eval_mean_token_accuracy": 0.8281808595978812, + "eval_num_tokens": 9399394.0, + "eval_runtime": 88.4328, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 4060 + }, + { + "entropy": 0.08719871481880545, + "epoch": 9.832830416415208, + "grad_norm": 0.17966455221176147, + "learning_rate": 3.3540155435645076e-07, + "loss": 0.05917760729789734, + "mean_token_accuracy": 0.9752349570393563, + "num_tokens": 9449483.0, + "step": 4080 + }, + { + "epoch": 9.832830416415208, + "eval_entropy": 0.2291418021816886, + "eval_loss": 1.0714553594589233, + "eval_mean_token_accuracy": 0.8281870403986299, + "eval_num_tokens": 9449483.0, + "eval_runtime": 88.2612, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 4080 + }, + { + "entropy": 0.07887464743107557, + "epoch": 9.88111044055522, + "grad_norm": 0.4397202134132385, + "learning_rate": 1.7308172075587924e-07, + "loss": 0.060457843542099, + "mean_token_accuracy": 0.9779011741280556, + "num_tokens": 9497731.0, + "step": 4100 + }, + { + "epoch": 9.88111044055522, + "eval_entropy": 0.2292038949855258, + "eval_loss": 1.0717124938964844, + "eval_mean_token_accuracy": 0.8282261353530241, + "eval_num_tokens": 9497731.0, + "eval_runtime": 88.5793, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 4100 + }, + { + "entropy": 0.07985925199463964, + "epoch": 9.929390464695233, + "grad_norm": 0.2129203975200653, + "learning_rate": 6.395525464895752e-08, + "loss": 0.05666370391845703, + "mean_token_accuracy": 0.9778168581426143, + "num_tokens": 9548917.0, + "step": 4120 + }, + { + "epoch": 9.929390464695233, + "eval_entropy": 0.22915430601393239, + "eval_loss": 1.0715631246566772, + "eval_mean_token_accuracy": 0.8282323436120923, + "eval_num_tokens": 9548917.0, + "eval_runtime": 88.4991, + "eval_samples_per_second": 16.045, + "eval_steps_per_second": 2.011, + "step": 4120 + }, + { + "entropy": 0.08802500045858323, + "epoch": 9.977670488835244, + "grad_norm": 0.18367069959640503, + "learning_rate": 8.053037534806845e-09, + "loss": 0.06633861660957337, + "mean_token_accuracy": 0.9749571368098259, + "num_tokens": 9592427.0, + "step": 4140 + }, + { + "epoch": 9.977670488835244, + "eval_entropy": 0.22921692956699413, + "eval_loss": 1.0715234279632568, + "eval_mean_token_accuracy": 0.828055245822735, + "eval_num_tokens": 9592427.0, + "eval_runtime": 88.1869, + "eval_samples_per_second": 16.102, + "eval_steps_per_second": 2.018, + "step": 4140 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.0573616119372186e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d86404192cf4dbc4a16df525ed84826e7a1d7dd1 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-4150/trainer_state.json @@ -0,0 +1,4392 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 10.0, + "eval_steps": 20, + "global_step": 4150, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + }, + { + "entropy": 0.6050681818276644, + "epoch": 2.4103802051901027, + "grad_norm": 0.9151566028594971, + "learning_rate": 0.00035404068900628076, + "loss": 0.559452486038208, + "mean_token_accuracy": 0.8310242861509323, + "num_tokens": 2319305.0, + "step": 1000 + }, + { + "epoch": 2.4103802051901027, + "eval_entropy": 0.6634890969549672, + "eval_loss": 0.6692465543746948, + "eval_mean_token_accuracy": 0.8134353673190213, + "eval_num_tokens": 2319305.0, + "eval_runtime": 87.7711, + "eval_samples_per_second": 16.178, + "eval_steps_per_second": 2.028, + "step": 1000 + }, + { + "entropy": 0.6169968567788601, + "epoch": 2.4586602293301145, + "grad_norm": 0.7081006765365601, + "learning_rate": 0.0003525243462115402, + "loss": 0.5589694023132324, + "mean_token_accuracy": 0.8357502184808254, + "num_tokens": 2368592.0, + "step": 1020 + }, + { + "epoch": 2.4586602293301145, + "eval_entropy": 0.6126393578695447, + "eval_loss": 0.6706712245941162, + "eval_mean_token_accuracy": 0.8155577500884452, + "eval_num_tokens": 2368592.0, + "eval_runtime": 88.1407, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.019, + "step": 1020 + }, + { + "entropy": 0.6072248566895724, + "epoch": 2.506940253470127, + "grad_norm": 0.6999370455741882, + "learning_rate": 0.0003509614855443561, + "loss": 0.5500593185424805, + "mean_token_accuracy": 0.8337264291942119, + "num_tokens": 2412859.0, + "step": 1040 + }, + { + "epoch": 2.506940253470127, + "eval_entropy": 0.6417417074187418, + "eval_loss": 0.6651163697242737, + "eval_mean_token_accuracy": 0.8159113908081912, + "eval_num_tokens": 2412859.0, + "eval_runtime": 87.4854, + "eval_samples_per_second": 16.231, + "eval_steps_per_second": 2.035, + "step": 1040 + }, + { + "entropy": 0.6301592070609331, + "epoch": 2.5552202776101387, + "grad_norm": 0.8768910765647888, + "learning_rate": 0.00034935254927581064, + "loss": 0.5613903999328613, + "mean_token_accuracy": 0.8298896946012974, + "num_tokens": 2458201.0, + "step": 1060 + }, + { + "epoch": 2.5552202776101387, + "eval_entropy": 0.6569794751285167, + "eval_loss": 0.6668341159820557, + "eval_mean_token_accuracy": 0.8126791795987761, + "eval_num_tokens": 2458201.0, + "eval_runtime": 88.0474, + "eval_samples_per_second": 16.128, + "eval_steps_per_second": 2.022, + "step": 1060 + }, + { + "entropy": 0.6069021724164486, + "epoch": 2.603500301750151, + "grad_norm": 0.9033508896827698, + "learning_rate": 0.0003476979927158357, + "loss": 0.5590654373168945, + "mean_token_accuracy": 0.831520090252161, + "num_tokens": 2505382.0, + "step": 1080 + }, + { + "epoch": 2.603500301750151, + "eval_entropy": 0.6636380777600106, + "eval_loss": 0.6596238017082214, + "eval_mean_token_accuracy": 0.8177202826135614, + "eval_num_tokens": 2505382.0, + "eval_runtime": 88.08, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1080 + }, + { + "entropy": 0.6138021353632211, + "epoch": 2.651780325890163, + "grad_norm": 0.7345808148384094, + "learning_rate": 0.0003459982840843664, + "loss": 0.5586410522460937, + "mean_token_accuracy": 0.8295876093208789, + "num_tokens": 2552927.0, + "step": 1100 + }, + { + "epoch": 2.651780325890163, + "eval_entropy": 0.5845904127600487, + "eval_loss": 0.663780689239502, + "eval_mean_token_accuracy": 0.8142095107710763, + "eval_num_tokens": 2552927.0, + "eval_runtime": 88.0083, + "eval_samples_per_second": 16.135, + "eval_steps_per_second": 2.023, + "step": 1100 + }, + { + "entropy": 0.6251844003796577, + "epoch": 2.700060350030175, + "grad_norm": 0.7587347626686096, + "learning_rate": 0.00034425390437883976, + "loss": 0.5720802307128906, + "mean_token_accuracy": 0.8285771444439888, + "num_tokens": 2597426.0, + "step": 1120 + }, + { + "epoch": 2.700060350030175, + "eval_entropy": 0.6251207221759839, + "eval_loss": 0.6556326746940613, + "eval_mean_token_accuracy": 0.8181774036937886, + "eval_num_tokens": 2597426.0, + "eval_runtime": 87.8517, + "eval_samples_per_second": 16.164, + "eval_steps_per_second": 2.026, + "step": 1120 + }, + { + "entropy": 0.6227757651358843, + "epoch": 2.748340374170187, + "grad_norm": 0.9254975914955139, + "learning_rate": 0.00034246534723807843, + "loss": 0.5767871856689453, + "mean_token_accuracy": 0.8292960874736309, + "num_tokens": 2640514.0, + "step": 1140 + }, + { + "epoch": 2.748340374170187, + "eval_entropy": 0.6580858331048087, + "eval_loss": 0.6579018831253052, + "eval_mean_token_accuracy": 0.8178701273510965, + "eval_num_tokens": 2640514.0, + "eval_runtime": 87.9523, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 1140 + }, + { + "entropy": 0.6353523321449757, + "epoch": 2.796620398310199, + "grad_norm": 1.4437663555145264, + "learning_rate": 0.00034063311880259663, + "loss": 0.566702127456665, + "mean_token_accuracy": 0.831210870295763, + "num_tokens": 2687730.0, + "step": 1160 + }, + { + "epoch": 2.796620398310199, + "eval_entropy": 0.6347215423423253, + "eval_loss": 0.6531020402908325, + "eval_mean_token_accuracy": 0.8189373260803436, + "eval_num_tokens": 2687730.0, + "eval_runtime": 88.0207, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1160 + }, + { + "entropy": 0.6233414955437183, + "epoch": 2.8449004224502112, + "grad_norm": 0.753302812576294, + "learning_rate": 0.0003387577375713684, + "loss": 0.5740012645721435, + "mean_token_accuracy": 0.8270302519202233, + "num_tokens": 2732930.0, + "step": 1180 + }, + { + "epoch": 2.8449004224502112, + "eval_entropy": 0.6291426423560368, + "eval_loss": 0.6549608707427979, + "eval_mean_token_accuracy": 0.8188753693961026, + "eval_num_tokens": 2732930.0, + "eval_runtime": 88.2306, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1180 + }, + { + "entropy": 0.617981968075037, + "epoch": 2.8931804465902236, + "grad_norm": 0.6777492165565491, + "learning_rate": 0.00033683973425509874, + "loss": 0.5558822631835938, + "mean_token_accuracy": 0.8315935507416725, + "num_tokens": 2779450.0, + "step": 1200 + }, + { + "epoch": 2.8931804465902236, + "eval_entropy": 0.6340839514571629, + "eval_loss": 0.6490646600723267, + "eval_mean_token_accuracy": 0.8200173856837026, + "eval_num_tokens": 2779450.0, + "eval_runtime": 88.3076, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1200 + }, + { + "entropy": 0.5989151727408171, + "epoch": 2.9414604707302354, + "grad_norm": 1.0503766536712646, + "learning_rate": 0.0003348796516260381, + "loss": 0.550087308883667, + "mean_token_accuracy": 0.8357349015772343, + "num_tokens": 2827819.0, + "step": 1220 + }, + { + "epoch": 2.9414604707302354, + "eval_entropy": 0.6683844726407127, + "eval_loss": 0.6455520987510681, + "eval_mean_token_accuracy": 0.8199967946229356, + "eval_num_tokens": 2827819.0, + "eval_runtime": 87.7825, + "eval_samples_per_second": 16.176, + "eval_steps_per_second": 2.028, + "step": 1220 + }, + { + "entropy": 0.6396764755249024, + "epoch": 2.9897404948702473, + "grad_norm": 0.7088311910629272, + "learning_rate": 0.00033287804436438515, + "loss": 0.5731344223022461, + "mean_token_accuracy": 0.8298504173755645, + "num_tokens": 2872493.0, + "step": 1240 + }, + { + "epoch": 2.9897404948702473, + "eval_entropy": 0.6510144954317072, + "eval_loss": 0.6509669423103333, + "eval_mean_token_accuracy": 0.8188618431600292, + "eval_num_tokens": 2872493.0, + "eval_runtime": 87.8954, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 1240 + }, + { + "entropy": 0.5436535887903982, + "epoch": 3.036210018105009, + "grad_norm": 0.8652629852294922, + "learning_rate": 0.00033083547890131815, + "loss": 0.4816119194030762, + "mean_token_accuracy": 0.8523989869402601, + "num_tokens": 2918249.0, + "step": 1260 + }, + { + "epoch": 3.036210018105009, + "eval_entropy": 0.5676146091035242, + "eval_loss": 0.6723794341087341, + "eval_mean_token_accuracy": 0.8197960103495737, + "eval_num_tokens": 2918249.0, + "eval_runtime": 88.1303, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1260 + }, + { + "entropy": 0.503798121958971, + "epoch": 3.084490042245021, + "grad_norm": 0.9403247237205505, + "learning_rate": 0.0003287525332587019, + "loss": 0.43859500885009767, + "mean_token_accuracy": 0.8604862734675407, + "num_tokens": 2968353.0, + "step": 1280 + }, + { + "epoch": 3.084490042245021, + "eval_entropy": 0.5981672088081917, + "eval_loss": 0.671315610408783, + "eval_mean_token_accuracy": 0.8175233046660263, + "eval_num_tokens": 2968353.0, + "eval_runtime": 88.3097, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1280 + }, + { + "entropy": 0.5218576818704606, + "epoch": 3.1327700663850333, + "grad_norm": 1.0271061658859253, + "learning_rate": 0.0003266297968855144, + "loss": 0.45096940994262696, + "mean_token_accuracy": 0.8555397011339665, + "num_tokens": 3018291.0, + "step": 1300 + }, + { + "epoch": 3.1327700663850333, + "eval_entropy": 0.5708769342202819, + "eval_loss": 0.6631077527999878, + "eval_mean_token_accuracy": 0.8207426647121987, + "eval_num_tokens": 3018291.0, + "eval_runtime": 87.7272, + "eval_samples_per_second": 16.187, + "eval_steps_per_second": 2.029, + "step": 1300 + }, + { + "entropy": 0.5191332377493382, + "epoch": 3.181050090525045, + "grad_norm": 0.958055317401886, + "learning_rate": 0.0003244678704910397, + "loss": 0.45679512023925783, + "mean_token_accuracy": 0.8554921194911003, + "num_tokens": 3070712.0, + "step": 1320 + }, + { + "epoch": 3.181050090525045, + "eval_entropy": 0.5703962919082535, + "eval_loss": 0.6597784161567688, + "eval_mean_token_accuracy": 0.821146364962117, + "eval_num_tokens": 3070712.0, + "eval_runtime": 88.4154, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 1320 + }, + { + "entropy": 0.5207117382436991, + "epoch": 3.2293301146650575, + "grad_norm": 0.7903274297714233, + "learning_rate": 0.00032226736587487434, + "loss": 0.44762430191040037, + "mean_token_accuracy": 0.8578196220099926, + "num_tokens": 3116564.0, + "step": 1340 + }, + { + "epoch": 3.2293301146650575, + "eval_entropy": 0.5453257858753204, + "eval_loss": 0.6688455939292908, + "eval_mean_token_accuracy": 0.8215647212574991, + "eval_num_tokens": 3116564.0, + "eval_runtime": 88.0214, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 1340 + }, + { + "entropy": 0.5263226825743914, + "epoch": 3.2776101388050694, + "grad_norm": 0.8782205581665039, + "learning_rate": 0.00032002890575379524, + "loss": 0.46592864990234373, + "mean_token_accuracy": 0.8551752805709839, + "num_tokens": 3164054.0, + "step": 1360 + }, + { + "epoch": 3.2776101388050694, + "eval_entropy": 0.5805480952343244, + "eval_loss": 0.6707106232643127, + "eval_mean_token_accuracy": 0.8191288441754458, + "eval_num_tokens": 3164054.0, + "eval_runtime": 88.2293, + "eval_samples_per_second": 16.094, + "eval_steps_per_second": 2.017, + "step": 1360 + }, + { + "entropy": 0.5454599127173424, + "epoch": 3.3258901629450817, + "grad_norm": 0.9048764705657959, + "learning_rate": 0.0003177531235855382, + "loss": 0.4763782501220703, + "mean_token_accuracy": 0.8505888104438781, + "num_tokens": 3207419.0, + "step": 1380 + }, + { + "epoch": 3.3258901629450817, + "eval_entropy": 0.5952914317002457, + "eval_loss": 0.662697970867157, + "eval_mean_token_accuracy": 0.819491108146946, + "eval_num_tokens": 3207419.0, + "eval_runtime": 87.9869, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 1380 + }, + { + "entropy": 0.5299010306596756, + "epoch": 3.3741701870850935, + "grad_norm": 0.8653950691223145, + "learning_rate": 0.000315440663389537, + "loss": 0.4581890106201172, + "mean_token_accuracy": 0.8536585591733455, + "num_tokens": 3252679.0, + "step": 1400 + }, + { + "epoch": 3.3741701870850935, + "eval_entropy": 0.5326506612675913, + "eval_loss": 0.6679039001464844, + "eval_mean_token_accuracy": 0.8209870109397374, + "eval_num_tokens": 3252679.0, + "eval_runtime": 88.3059, + "eval_samples_per_second": 16.08, + "eval_steps_per_second": 2.016, + "step": 1400 + }, + { + "entropy": 0.5074611511081457, + "epoch": 3.4224502112251054, + "grad_norm": 0.7786624431610107, + "learning_rate": 0.00031309217956467325, + "loss": 0.45597033500671386, + "mean_token_accuracy": 0.856324628740549, + "num_tokens": 3297309.0, + "step": 1420 + }, + { + "epoch": 3.4224502112251054, + "eval_entropy": 0.5424539073464576, + "eval_loss": 0.6710956692695618, + "eval_mean_token_accuracy": 0.8209191105338964, + "eval_num_tokens": 3297309.0, + "eval_runtime": 87.2334, + "eval_samples_per_second": 16.278, + "eval_steps_per_second": 2.041, + "step": 1420 + }, + { + "entropy": 0.5192026473581791, + "epoch": 3.4707302353651177, + "grad_norm": 0.7682847380638123, + "learning_rate": 0.0003107083367040895, + "loss": 0.46319098472595216, + "mean_token_accuracy": 0.8517456069588661, + "num_tokens": 3341825.0, + "step": 1440 + }, + { + "epoch": 3.4707302353651177, + "eval_entropy": 0.569345246372598, + "eval_loss": 0.6640089154243469, + "eval_mean_token_accuracy": 0.8204013628236363, + "eval_num_tokens": 3341825.0, + "eval_runtime": 87.668, + "eval_samples_per_second": 16.197, + "eval_steps_per_second": 2.03, + "step": 1440 + }, + { + "entropy": 0.5302285175770521, + "epoch": 3.51901025950513, + "grad_norm": 0.9500018954277039, + "learning_rate": 0.00030828980940711723, + "loss": 0.4712235927581787, + "mean_token_accuracy": 0.8510453663766384, + "num_tokens": 3388463.0, + "step": 1460 + }, + { + "epoch": 3.51901025950513, + "eval_entropy": 0.5648383499866121, + "eval_loss": 0.6629963517189026, + "eval_mean_token_accuracy": 0.8197558281126986, + "eval_num_tokens": 3388463.0, + "eval_runtime": 87.9214, + "eval_samples_per_second": 16.151, + "eval_steps_per_second": 2.025, + "step": 1460 + }, + { + "entropy": 0.5347354769706726, + "epoch": 3.567290283645142, + "grad_norm": 0.9935700297355652, + "learning_rate": 0.00030583728208837305, + "loss": 0.47901196479797364, + "mean_token_accuracy": 0.8491650126874447, + "num_tokens": 3433731.0, + "step": 1480 + }, + { + "epoch": 3.567290283645142, + "eval_entropy": 0.5595698517360045, + "eval_loss": 0.6594937443733215, + "eval_mean_token_accuracy": 0.8217685289597243, + "eval_num_tokens": 3433731.0, + "eval_runtime": 88.1348, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 1480 + }, + { + "entropy": 0.5250448524951935, + "epoch": 3.6155703077851538, + "grad_norm": 0.8686122894287109, + "learning_rate": 0.0003033514487840775, + "loss": 0.48284616470336916, + "mean_token_accuracy": 0.8505332618951797, + "num_tokens": 3478600.0, + "step": 1500 + }, + { + "epoch": 3.6155703077851538, + "eval_entropy": 0.5399963330017047, + "eval_loss": 0.6682186722755432, + "eval_mean_token_accuracy": 0.8201540199558387, + "eval_num_tokens": 3478600.0, + "eval_runtime": 87.9383, + "eval_samples_per_second": 16.148, + "eval_steps_per_second": 2.024, + "step": 1500 + }, + { + "entropy": 0.5496356297284365, + "epoch": 3.663850331925166, + "grad_norm": 0.9891234636306763, + "learning_rate": 0.00030083301295565117, + "loss": 0.4842066287994385, + "mean_token_accuracy": 0.8493696190416813, + "num_tokens": 3521787.0, + "step": 1520 + }, + { + "epoch": 3.663850331925166, + "eval_entropy": 0.5889502502559276, + "eval_loss": 0.6597762703895569, + "eval_mean_token_accuracy": 0.819690072469497, + "eval_num_tokens": 3521787.0, + "eval_runtime": 88.0165, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1520 + }, + { + "entropy": 0.5289484921842813, + "epoch": 3.712130356065178, + "grad_norm": 0.7241885662078857, + "learning_rate": 0.00029828268729064326, + "loss": 0.48619561195373534, + "mean_token_accuracy": 0.8518108949065208, + "num_tokens": 3569036.0, + "step": 1540 + }, + { + "epoch": 3.712130356065178, + "eval_entropy": 0.5958652837892596, + "eval_loss": 0.6565147042274475, + "eval_mean_token_accuracy": 0.8217123010185328, + "eval_num_tokens": 3569036.0, + "eval_runtime": 88.0126, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1540 + }, + { + "entropy": 0.5450621031224727, + "epoch": 3.7604103802051903, + "grad_norm": 0.7989155650138855, + "learning_rate": 0.0002957011935010495, + "loss": 0.48642635345458984, + "mean_token_accuracy": 0.8462958924472332, + "num_tokens": 3614313.0, + "step": 1560 + }, + { + "epoch": 3.7604103802051903, + "eval_entropy": 0.5554354205895006, + "eval_loss": 0.6484317183494568, + "eval_mean_token_accuracy": 0.823845865016573, + "eval_num_tokens": 3614313.0, + "eval_runtime": 88.2711, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1560 + }, + { + "entropy": 0.5318546604365111, + "epoch": 3.808690404345202, + "grad_norm": 1.0375983715057373, + "learning_rate": 0.00029308926211907624, + "loss": 0.4860549449920654, + "mean_token_accuracy": 0.8488477177917957, + "num_tokens": 3659786.0, + "step": 1580 + }, + { + "epoch": 3.808690404345202, + "eval_entropy": 0.5575427207049359, + "eval_loss": 0.659203827381134, + "eval_mean_token_accuracy": 0.8210098288032446, + "eval_num_tokens": 3659786.0, + "eval_runtime": 88.3024, + "eval_samples_per_second": 16.081, + "eval_steps_per_second": 2.016, + "step": 1580 + }, + { + "entropy": 0.5312924966216087, + "epoch": 3.856970428485214, + "grad_norm": 0.9233641624450684, + "learning_rate": 0.00029044763229040845, + "loss": 0.48835930824279783, + "mean_token_accuracy": 0.8447530090808868, + "num_tokens": 3706362.0, + "step": 1600 + }, + { + "epoch": 3.856970428485214, + "eval_entropy": 0.5433843780434533, + "eval_loss": 0.6514624953269958, + "eval_mean_token_accuracy": 0.8230627580974879, + "eval_num_tokens": 3706362.0, + "eval_runtime": 87.9727, + "eval_samples_per_second": 16.141, + "eval_steps_per_second": 2.023, + "step": 1600 + }, + { + "entropy": 0.5400687273591757, + "epoch": 3.9052504526252263, + "grad_norm": 0.7173060178756714, + "learning_rate": 0.00028777705156504007, + "loss": 0.486147403717041, + "mean_token_accuracy": 0.8478169530630112, + "num_tokens": 3753013.0, + "step": 1620 + }, + { + "epoch": 3.9052504526252263, + "eval_entropy": 0.5856067625324378, + "eval_loss": 0.6469284892082214, + "eval_mean_token_accuracy": 0.8219244604030352, + "eval_num_tokens": 3753013.0, + "eval_runtime": 88.0776, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1620 + }, + { + "entropy": 0.5115721028298139, + "epoch": 3.9535304767652386, + "grad_norm": 1.0881255865097046, + "learning_rate": 0.00028507827568572655, + "loss": 0.47065014839172364, + "mean_token_accuracy": 0.8535217240452766, + "num_tokens": 3800024.0, + "step": 1640 + }, + { + "epoch": 3.9535304767652386, + "eval_entropy": 0.565960791003838, + "eval_loss": 0.6459378004074097, + "eval_mean_token_accuracy": 0.8246003888296277, + "eval_num_tokens": 3800024.0, + "eval_runtime": 88.4974, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 1640 + }, + { + "entropy": 0.5376694152107486, + "epoch": 4.0, + "grad_norm": 3.4068243503570557, + "learning_rate": 0.0002823520683741183, + "loss": 0.4839733600616455, + "mean_token_accuracy": 0.8507238850965129, + "num_tokens": 3844304.0, + "step": 1660 + }, + { + "epoch": 4.0, + "eval_entropy": 0.5631327726198047, + "eval_loss": 0.6423600316047668, + "eval_mean_token_accuracy": 0.82502972175566, + "eval_num_tokens": 3844304.0, + "eval_runtime": 88.1524, + "eval_samples_per_second": 16.108, + "eval_steps_per_second": 2.019, + "step": 1660 + }, + { + "entropy": 0.4188325941562653, + "epoch": 4.048280024140012, + "grad_norm": 0.6339647173881531, + "learning_rate": 0.00027959920111463656, + "loss": 0.3500279426574707, + "mean_token_accuracy": 0.8840543255209923, + "num_tokens": 3890738.0, + "step": 1680 + }, + { + "epoch": 4.048280024140012, + "eval_entropy": 0.5159014272555876, + "eval_loss": 0.6822672486305237, + "eval_mean_token_accuracy": 0.8223584498582261, + "eval_num_tokens": 3890738.0, + "eval_runtime": 87.8011, + "eval_samples_per_second": 16.173, + "eval_steps_per_second": 2.027, + "step": 1680 + }, + { + "entropy": 0.42600946351885793, + "epoch": 4.096560048280024, + "grad_norm": 0.6938858032226562, + "learning_rate": 0.0002768204529361524, + "loss": 0.3462975263595581, + "mean_token_accuracy": 0.8850771695375442, + "num_tokens": 3938205.0, + "step": 1700 + }, + { + "epoch": 4.096560048280024, + "eval_entropy": 0.4818309486916896, + "eval_loss": 0.697238028049469, + "eval_mean_token_accuracy": 0.822570590825563, + "eval_num_tokens": 3938205.0, + "eval_runtime": 87.6294, + "eval_samples_per_second": 16.205, + "eval_steps_per_second": 2.031, + "step": 1700 + }, + { + "entropy": 0.4128956265747547, + "epoch": 4.1448400724200365, + "grad_norm": 0.7023837566375732, + "learning_rate": 0.000274016610191531, + "loss": 0.35343332290649415, + "mean_token_accuracy": 0.8837565891444683, + "num_tokens": 3986350.0, + "step": 1720 + }, + { + "epoch": 4.1448400724200365, + "eval_entropy": 0.4736787666765492, + "eval_loss": 0.686392605304718, + "eval_mean_token_accuracy": 0.8246323891570059, + "eval_num_tokens": 3986350.0, + "eval_runtime": 87.755, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 1720 + }, + { + "entropy": 0.4070820797234774, + "epoch": 4.193120096560048, + "grad_norm": 0.7664099335670471, + "learning_rate": 0.00027118846633510276, + "loss": 0.35689282417297363, + "mean_token_accuracy": 0.8821764968335628, + "num_tokens": 4033541.0, + "step": 1740 + }, + { + "epoch": 4.193120096560048, + "eval_entropy": 0.48123268063148755, + "eval_loss": 0.6800221800804138, + "eval_mean_token_accuracy": 0.8234515280536051, + "eval_num_tokens": 4033541.0, + "eval_runtime": 87.613, + "eval_samples_per_second": 16.208, + "eval_steps_per_second": 2.032, + "step": 1740 + }, + { + "entropy": 0.4199690703302622, + "epoch": 4.24140012070006, + "grad_norm": 0.7411720752716064, + "learning_rate": 0.00026833682169812544, + "loss": 0.35881006717681885, + "mean_token_accuracy": 0.8812312394380569, + "num_tokens": 4079253.0, + "step": 1760 + }, + { + "epoch": 4.24140012070006, + "eval_entropy": 0.47287314242861245, + "eval_loss": 0.691737949848175, + "eval_mean_token_accuracy": 0.8229516232281588, + "eval_num_tokens": 4079253.0, + "eval_runtime": 87.9596, + "eval_samples_per_second": 16.144, + "eval_steps_per_second": 2.024, + "step": 1760 + }, + { + "entropy": 0.4195733394473791, + "epoch": 4.289680144840072, + "grad_norm": 0.9975268244743347, + "learning_rate": 0.00026546248326229954, + "loss": 0.36998801231384276, + "mean_token_accuracy": 0.8777976937592029, + "num_tokens": 4125495.0, + "step": 1780 + }, + { + "epoch": 4.289680144840072, + "eval_entropy": 0.48877454825331657, + "eval_loss": 0.6843481063842773, + "eval_mean_token_accuracy": 0.8226028995567494, + "eval_num_tokens": 4125495.0, + "eval_runtime": 88.169, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 1780 + }, + { + "entropy": 0.4087799321860075, + "epoch": 4.337960168980085, + "grad_norm": 0.8101420402526855, + "learning_rate": 0.00026256626443140217, + "loss": 0.3555623531341553, + "mean_token_accuracy": 0.8815289497375488, + "num_tokens": 4173422.0, + "step": 1800 + }, + { + "epoch": 4.337960168980085, + "eval_entropy": 0.4845838766084628, + "eval_loss": 0.6782916188240051, + "eval_mean_token_accuracy": 0.8235659428526846, + "eval_num_tokens": 4173422.0, + "eval_runtime": 88.0763, + "eval_samples_per_second": 16.122, + "eval_steps_per_second": 2.021, + "step": 1800 + }, + { + "entropy": 0.4086425334215164, + "epoch": 4.386240193120097, + "grad_norm": 0.8936498761177063, + "learning_rate": 0.0002596489848011036, + "loss": 0.3710860013961792, + "mean_token_accuracy": 0.8773891530930996, + "num_tokens": 4216243.0, + "step": 1820 + }, + { + "epoch": 4.386240193120097, + "eval_entropy": 0.49018637685293565, + "eval_loss": 0.6762362718582153, + "eval_mean_token_accuracy": 0.8242661363623115, + "eval_num_tokens": 4216243.0, + "eval_runtime": 88.3684, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 1820 + }, + { + "entropy": 0.41956189945340155, + "epoch": 4.434520217260109, + "grad_norm": 0.6450079083442688, + "learning_rate": 0.00025671146992703106, + "loss": 0.3715682029724121, + "mean_token_accuracy": 0.878043319284916, + "num_tokens": 4262463.0, + "step": 1840 + }, + { + "epoch": 4.434520217260109, + "eval_entropy": 0.4821142643020394, + "eval_loss": 0.6749269962310791, + "eval_mean_token_accuracy": 0.8252766048640348, + "eval_num_tokens": 4262463.0, + "eval_runtime": 87.6946, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 1840 + }, + { + "entropy": 0.40638086050748823, + "epoch": 4.4828002414001205, + "grad_norm": 0.8167530298233032, + "learning_rate": 0.0002537545510911465, + "loss": 0.3652146100997925, + "mean_token_accuracy": 0.8761600315570831, + "num_tokens": 4311451.0, + "step": 1860 + }, + { + "epoch": 4.4828002414001205, + "eval_entropy": 0.5017492558514134, + "eval_loss": 0.6696512699127197, + "eval_mean_token_accuracy": 0.8252955695216575, + "eval_num_tokens": 4311451.0, + "eval_runtime": 88.02, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 1860 + }, + { + "entropy": 0.41664722077548505, + "epoch": 4.531080265540133, + "grad_norm": 0.757738471031189, + "learning_rate": 0.0002507790650665036, + "loss": 0.368887734413147, + "mean_token_accuracy": 0.8786893397569656, + "num_tokens": 4357724.0, + "step": 1880 + }, + { + "epoch": 4.531080265540133, + "eval_entropy": 0.4798511176296834, + "eval_loss": 0.6738249659538269, + "eval_mean_token_accuracy": 0.8250340461061242, + "eval_num_tokens": 4357724.0, + "eval_runtime": 88.2713, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 1880 + }, + { + "entropy": 0.42732664197683334, + "epoch": 4.579360289680145, + "grad_norm": 0.7890474200248718, + "learning_rate": 0.00024778585388045044, + "loss": 0.38672595024108886, + "mean_token_accuracy": 0.8742976360023021, + "num_tokens": 4401934.0, + "step": 1900 + }, + { + "epoch": 4.579360289680145, + "eval_entropy": 0.49321879295820603, + "eval_loss": 0.6752269268035889, + "eval_mean_token_accuracy": 0.824115453811174, + "eval_num_tokens": 4401934.0, + "eval_runtime": 87.3378, + "eval_samples_per_second": 16.259, + "eval_steps_per_second": 2.038, + "step": 1900 + }, + { + "entropy": 0.41300065964460375, + "epoch": 4.627640313820157, + "grad_norm": 0.866765022277832, + "learning_rate": 0.00024477576457634665, + "loss": 0.364247989654541, + "mean_token_accuracy": 0.8774793080985546, + "num_tokens": 4449745.0, + "step": 1920 + }, + { + "epoch": 4.627640313820157, + "eval_entropy": 0.49179744352115673, + "eval_loss": 0.6731056571006775, + "eval_mean_token_accuracy": 0.8245729244826885, + "eval_num_tokens": 4449745.0, + "eval_runtime": 88.2458, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 1920 + }, + { + "entropy": 0.42646181732416155, + "epoch": 4.675920337960169, + "grad_norm": 0.7921772003173828, + "learning_rate": 0.00024174964897385928, + "loss": 0.3822937488555908, + "mean_token_accuracy": 0.8755100265145301, + "num_tokens": 4495074.0, + "step": 1940 + }, + { + "epoch": 4.675920337960169, + "eval_entropy": 0.5194089940089858, + "eval_loss": 0.6604889631271362, + "eval_mean_token_accuracy": 0.8260471847619903, + "eval_num_tokens": 4495074.0, + "eval_runtime": 88.0139, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 1940 + }, + { + "entropy": 0.4235709119588137, + "epoch": 4.724200362100181, + "grad_norm": 0.8816011548042297, + "learning_rate": 0.00023870836342790837, + "loss": 0.3772272109985352, + "mean_token_accuracy": 0.8731484808027744, + "num_tokens": 4541053.0, + "step": 1960 + }, + { + "epoch": 4.724200362100181, + "eval_entropy": 0.47387497545628066, + "eval_loss": 0.6644074320793152, + "eval_mean_token_accuracy": 0.8271099258674665, + "eval_num_tokens": 4541053.0, + "eval_runtime": 88.393, + "eval_samples_per_second": 16.065, + "eval_steps_per_second": 2.014, + "step": 1960 + }, + { + "entropy": 0.42933564484119413, + "epoch": 4.772480386240193, + "grad_norm": 0.9746852517127991, + "learning_rate": 0.0002356527685863284, + "loss": 0.3843918561935425, + "mean_token_accuracy": 0.873461090028286, + "num_tokens": 4584210.0, + "step": 1980 + }, + { + "epoch": 4.772480386240193, + "eval_entropy": 0.47977291734031074, + "eval_loss": 0.6671409010887146, + "eval_mean_token_accuracy": 0.8273240890395775, + "eval_num_tokens": 4584210.0, + "eval_runtime": 88.6022, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 1980 + }, + { + "entropy": 0.44694459773600104, + "epoch": 4.820760410380205, + "grad_norm": 0.7372738122940063, + "learning_rate": 0.00023258372914631542, + "loss": 0.38873090744018557, + "mean_token_accuracy": 0.871940117329359, + "num_tokens": 4630254.0, + "step": 2000 + }, + { + "epoch": 4.820760410380205, + "eval_entropy": 0.49700497023844986, + "eval_loss": 0.6683036088943481, + "eval_mean_token_accuracy": 0.8265726067376941, + "eval_num_tokens": 4630254.0, + "eval_runtime": 88.1382, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 2000 + }, + { + "entropy": 0.42922686524689196, + "epoch": 4.869040434520217, + "grad_norm": 0.6791961789131165, + "learning_rate": 0.0002295021136097277, + "loss": 0.3735378265380859, + "mean_token_accuracy": 0.8772910334169864, + "num_tokens": 4679265.0, + "step": 2020 + }, + { + "epoch": 4.869040434520217, + "eval_entropy": 0.49750003386079594, + "eval_loss": 0.66725093126297, + "eval_mean_token_accuracy": 0.8255943565556173, + "eval_num_tokens": 4679265.0, + "eval_runtime": 86.9873, + "eval_samples_per_second": 16.324, + "eval_steps_per_second": 2.046, + "step": 2020 + }, + { + "entropy": 0.4518359176814556, + "epoch": 4.917320458660229, + "grad_norm": 0.7970417141914368, + "learning_rate": 0.00022640879403731002, + "loss": 0.38829789161682127, + "mean_token_accuracy": 0.8700004398822785, + "num_tokens": 4723592.0, + "step": 2040 + }, + { + "epoch": 4.917320458660229, + "eval_entropy": 0.4902817869789145, + "eval_loss": 0.6645081639289856, + "eval_mean_token_accuracy": 0.8280317391572374, + "eval_num_tokens": 4723592.0, + "eval_runtime": 87.4334, + "eval_samples_per_second": 16.241, + "eval_steps_per_second": 2.036, + "step": 2040 + }, + { + "entropy": 0.4405197504907846, + "epoch": 4.965600482800241, + "grad_norm": 1.0449241399765015, + "learning_rate": 0.00022330464580191104, + "loss": 0.3832916975021362, + "mean_token_accuracy": 0.8744640938937664, + "num_tokens": 4767253.0, + "step": 2060 + }, + { + "epoch": 4.965600482800241, + "eval_entropy": 0.4897575577658214, + "eval_loss": 0.6547137498855591, + "eval_mean_token_accuracy": 0.8286678559994429, + "eval_num_tokens": 4767253.0, + "eval_runtime": 88.2716, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 2060 + }, + { + "entropy": 0.38312033089724457, + "epoch": 5.012070006035003, + "grad_norm": 0.6516358256340027, + "learning_rate": 0.0002201905473407628, + "loss": 0.3343928098678589, + "mean_token_accuracy": 0.8923151601444591, + "num_tokens": 4816587.0, + "step": 2080 + }, + { + "epoch": 5.012070006035003, + "eval_entropy": 0.4274808027771082, + "eval_loss": 0.6996631026268005, + "eval_mean_token_accuracy": 0.8259488166718001, + "eval_num_tokens": 4816587.0, + "eval_runtime": 88.3757, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 2080 + }, + { + "entropy": 0.3049557346850634, + "epoch": 5.060350030175015, + "grad_norm": 0.6272661685943604, + "learning_rate": 0.00021706737990689358, + "loss": 0.2521080255508423, + "mean_token_accuracy": 0.912626949697733, + "num_tokens": 4861071.0, + "step": 2100 + }, + { + "epoch": 5.060350030175015, + "eval_entropy": 0.41769456176945335, + "eval_loss": 0.7133082151412964, + "eval_mean_token_accuracy": 0.8254162324278542, + "eval_num_tokens": 4861071.0, + "eval_runtime": 87.9672, + "eval_samples_per_second": 16.142, + "eval_steps_per_second": 2.023, + "step": 2100 + }, + { + "entropy": 0.31178536619991065, + "epoch": 5.108630054315027, + "grad_norm": 0.9577748775482178, + "learning_rate": 0.0002139360273197436, + "loss": 0.24547300338745118, + "mean_token_accuracy": 0.9145238555967807, + "num_tokens": 4904742.0, + "step": 2120 + }, + { + "epoch": 5.108630054315027, + "eval_entropy": 0.42631214170643456, + "eval_loss": 0.7339685559272766, + "eval_mean_token_accuracy": 0.8219655203015617, + "eval_num_tokens": 4904742.0, + "eval_runtime": 87.9257, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 2120 + }, + { + "entropy": 0.3008375624194741, + "epoch": 5.15691007845504, + "grad_norm": 0.797623336315155, + "learning_rate": 0.00021079737571505472, + "loss": 0.24592554569244385, + "mean_token_accuracy": 0.9159514293074608, + "num_tokens": 4950795.0, + "step": 2140 + }, + { + "epoch": 5.15691007845504, + "eval_entropy": 0.4180516125111098, + "eval_loss": 0.7242252826690674, + "eval_mean_token_accuracy": 0.8247456322895007, + "eval_num_tokens": 4950795.0, + "eval_runtime": 87.832, + "eval_samples_per_second": 16.167, + "eval_steps_per_second": 2.027, + "step": 2140 + }, + { + "entropy": 0.32739414311945436, + "epoch": 5.2051901025950515, + "grad_norm": 0.6331654191017151, + "learning_rate": 0.00020765231329410443, + "loss": 0.2587909460067749, + "mean_token_accuracy": 0.9127019934356213, + "num_tokens": 4994886.0, + "step": 2160 + }, + { + "epoch": 5.2051901025950515, + "eval_entropy": 0.43612574191575637, + "eval_loss": 0.7163131833076477, + "eval_mean_token_accuracy": 0.8249044545580831, + "eval_num_tokens": 4994886.0, + "eval_runtime": 88.184, + "eval_samples_per_second": 16.103, + "eval_steps_per_second": 2.019, + "step": 2160 + }, + { + "entropy": 0.31282360590994357, + "epoch": 5.253470126735063, + "grad_norm": 0.8501704931259155, + "learning_rate": 0.00020450173007235538, + "loss": 0.2543140649795532, + "mean_token_accuracy": 0.9109282083809376, + "num_tokens": 5043663.0, + "step": 2180 + }, + { + "epoch": 5.253470126735063, + "eval_entropy": 0.42737145202883176, + "eval_loss": 0.715088963508606, + "eval_mean_token_accuracy": 0.8260066037097674, + "eval_num_tokens": 5043663.0, + "eval_runtime": 88.1598, + "eval_samples_per_second": 16.107, + "eval_steps_per_second": 2.019, + "step": 2180 + }, + { + "entropy": 0.31767325326800344, + "epoch": 5.301750150875075, + "grad_norm": 0.808242917060852, + "learning_rate": 0.0002013465176275914, + "loss": 0.25598506927490233, + "mean_token_accuracy": 0.9112607099115848, + "num_tokens": 5087959.0, + "step": 2200 + }, + { + "epoch": 5.301750150875075, + "eval_entropy": 0.420320589723212, + "eval_loss": 0.7172654867172241, + "eval_mean_token_accuracy": 0.8260447238938192, + "eval_num_tokens": 5087959.0, + "eval_runtime": 88.1646, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 2200 + }, + { + "entropy": 0.30062707886099815, + "epoch": 5.350030175015087, + "grad_norm": 0.7561016082763672, + "learning_rate": 0.0001981875688476119, + "loss": 0.24859883785247802, + "mean_token_accuracy": 0.9129510529339313, + "num_tokens": 5136121.0, + "step": 2220 + }, + { + "epoch": 5.350030175015087, + "eval_entropy": 0.4228216555346264, + "eval_loss": 0.722082257270813, + "eval_mean_token_accuracy": 0.8257333281334867, + "eval_num_tokens": 5136121.0, + "eval_runtime": 88.2664, + "eval_samples_per_second": 16.088, + "eval_steps_per_second": 2.017, + "step": 2220 + }, + { + "entropy": 0.3080605179071426, + "epoch": 5.3983101991551, + "grad_norm": 0.8511217832565308, + "learning_rate": 0.00019502577767755477, + "loss": 0.2575610876083374, + "mean_token_accuracy": 0.9120334684848785, + "num_tokens": 5182144.0, + "step": 2240 + }, + { + "epoch": 5.3983101991551, + "eval_entropy": 0.407860318931301, + "eval_loss": 0.7172144651412964, + "eval_mean_token_accuracy": 0.8263489242350117, + "eval_num_tokens": 5182144.0, + "eval_runtime": 88.1308, + "eval_samples_per_second": 16.112, + "eval_steps_per_second": 2.02, + "step": 2240 + }, + { + "entropy": 0.30764442328363656, + "epoch": 5.446590223295112, + "grad_norm": 0.928459107875824, + "learning_rate": 0.0001918620388669208, + "loss": 0.2558996915817261, + "mean_token_accuracy": 0.9127804256975651, + "num_tokens": 5226845.0, + "step": 2260 + }, + { + "epoch": 5.446590223295112, + "eval_entropy": 0.40719465191444654, + "eval_loss": 0.7216960191726685, + "eval_mean_token_accuracy": 0.8262304382377796, + "eval_num_tokens": 5226845.0, + "eval_runtime": 88.4134, + "eval_samples_per_second": 16.061, + "eval_steps_per_second": 2.013, + "step": 2260 + }, + { + "entropy": 0.30657214783132075, + "epoch": 5.494870247435124, + "grad_norm": 0.90412437915802, + "learning_rate": 0.00018869724771637, + "loss": 0.259705924987793, + "mean_token_accuracy": 0.9097815379500389, + "num_tokens": 5272403.0, + "step": 2280 + }, + { + "epoch": 5.494870247435124, + "eval_entropy": 0.39945232700765804, + "eval_loss": 0.7241353392601013, + "eval_mean_token_accuracy": 0.8252729776869999, + "eval_num_tokens": 5272403.0, + "eval_runtime": 88.2952, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 2280 + }, + { + "entropy": 0.2879099613055587, + "epoch": 5.5431502715751355, + "grad_norm": 0.8688379526138306, + "learning_rate": 0.00018553229982436206, + "loss": 0.24692924022674562, + "mean_token_accuracy": 0.913682048022747, + "num_tokens": 5320882.0, + "step": 2300 + }, + { + "epoch": 5.5431502715751355, + "eval_entropy": 0.39947180751334416, + "eval_loss": 0.7101960182189941, + "eval_mean_token_accuracy": 0.82783506827408, + "eval_num_tokens": 5320882.0, + "eval_runtime": 88.4907, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2300 + }, + { + "entropy": 0.3070108935236931, + "epoch": 5.591430295715147, + "grad_norm": 0.7736193537712097, + "learning_rate": 0.00018236809083371273, + "loss": 0.2597432851791382, + "mean_token_accuracy": 0.90810831412673, + "num_tokens": 5370943.0, + "step": 2320 + }, + { + "epoch": 5.591430295715147, + "eval_entropy": 0.4090571740035261, + "eval_loss": 0.7136856913566589, + "eval_mean_token_accuracy": 0.8271592694721864, + "eval_num_tokens": 5370943.0, + "eval_runtime": 88.0111, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 2320 + }, + { + "entropy": 0.2969514708966017, + "epoch": 5.63971031985516, + "grad_norm": 0.8571580052375793, + "learning_rate": 0.00017920551617813733, + "loss": 0.25244779586791993, + "mean_token_accuracy": 0.9115345612168312, + "num_tokens": 5420284.0, + "step": 2340 + }, + { + "epoch": 5.63971031985516, + "eval_entropy": 0.4035519739885009, + "eval_loss": 0.7175078988075256, + "eval_mean_token_accuracy": 0.828284356031525, + "eval_num_tokens": 5420284.0, + "eval_runtime": 87.9478, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2340 + }, + { + "entropy": 0.2961398035287857, + "epoch": 5.687990343995172, + "grad_norm": 0.933102011680603, + "learning_rate": 0.0001760454708288538, + "loss": 0.2576280117034912, + "mean_token_accuracy": 0.9119551591575146, + "num_tokens": 5469507.0, + "step": 2360 + }, + { + "epoch": 5.687990343995172, + "eval_entropy": 0.41212199142809663, + "eval_loss": 0.7149607539176941, + "eval_mean_token_accuracy": 0.8266791905579942, + "eval_num_tokens": 5469507.0, + "eval_runtime": 87.7632, + "eval_samples_per_second": 16.18, + "eval_steps_per_second": 2.028, + "step": 2360 + }, + { + "entropy": 0.3072124743834138, + "epoch": 5.736270368135184, + "grad_norm": 0.7064250707626343, + "learning_rate": 0.00017288884904131615, + "loss": 0.258055591583252, + "mean_token_accuracy": 0.9088842839002609, + "num_tokens": 5514274.0, + "step": 2380 + }, + { + "epoch": 5.736270368135184, + "eval_entropy": 0.39512370325876084, + "eval_loss": 0.7194926738739014, + "eval_mean_token_accuracy": 0.8285625402847033, + "eval_num_tokens": 5514274.0, + "eval_runtime": 87.9474, + "eval_samples_per_second": 16.146, + "eval_steps_per_second": 2.024, + "step": 2380 + }, + { + "entropy": 0.31159722357988356, + "epoch": 5.784550392275197, + "grad_norm": 0.6565853953361511, + "learning_rate": 0.00016973654410215114, + "loss": 0.2594040632247925, + "mean_token_accuracy": 0.9096784308552742, + "num_tokens": 5561349.0, + "step": 2400 + }, + { + "epoch": 5.784550392275197, + "eval_entropy": 0.4137382763490248, + "eval_loss": 0.7111276984214783, + "eval_mean_token_accuracy": 0.8272288163726249, + "eval_num_tokens": 5561349.0, + "eval_runtime": 88.0204, + "eval_samples_per_second": 16.133, + "eval_steps_per_second": 2.022, + "step": 2400 + }, + { + "entropy": 0.3013706898316741, + "epoch": 5.8328304164152085, + "grad_norm": 0.7962143421173096, + "learning_rate": 0.00016658944807636825, + "loss": 0.25681519508361816, + "mean_token_accuracy": 0.9116937138140202, + "num_tokens": 5608215.0, + "step": 2420 + }, + { + "epoch": 5.8328304164152085, + "eval_entropy": 0.4103235746367594, + "eval_loss": 0.7075955271720886, + "eval_mean_token_accuracy": 0.8287353076961603, + "eval_num_tokens": 5608215.0, + "eval_runtime": 88.4363, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 2420 + }, + { + "entropy": 0.30746946930885316, + "epoch": 5.88111044055522, + "grad_norm": 0.8445194363594055, + "learning_rate": 0.0001634484515549164, + "loss": 0.25779383182525634, + "mean_token_accuracy": 0.9099907353520393, + "num_tokens": 5653216.0, + "step": 2440 + }, + { + "epoch": 5.88111044055522, + "eval_entropy": 0.39043665166651265, + "eval_loss": 0.7137237787246704, + "eval_mean_token_accuracy": 0.8278630744205432, + "eval_num_tokens": 5653216.0, + "eval_runtime": 88.2017, + "eval_samples_per_second": 16.099, + "eval_steps_per_second": 2.018, + "step": 2440 + }, + { + "entropy": 0.3028501259163022, + "epoch": 5.929390464695232, + "grad_norm": 0.7994105815887451, + "learning_rate": 0.0001603144434026566, + "loss": 0.2614556074142456, + "mean_token_accuracy": 0.9096644438803196, + "num_tokens": 5698417.0, + "step": 2460 + }, + { + "epoch": 5.929390464695232, + "eval_entropy": 0.41160977790864667, + "eval_loss": 0.7089618444442749, + "eval_mean_token_accuracy": 0.8270713757263141, + "eval_num_tokens": 5698417.0, + "eval_runtime": 88.1176, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2460 + }, + { + "entropy": 0.3106454351916909, + "epoch": 5.977670488835244, + "grad_norm": 0.7986742854118347, + "learning_rate": 0.0001571883105068242, + "loss": 0.26073107719421384, + "mean_token_accuracy": 0.9098567090928554, + "num_tokens": 5744944.0, + "step": 2480 + }, + { + "epoch": 5.977670488835244, + "eval_entropy": 0.39703783945421156, + "eval_loss": 0.7098209857940674, + "eval_mean_token_accuracy": 0.8296985512369135, + "eval_num_tokens": 5744944.0, + "eval_runtime": 88.0813, + "eval_samples_per_second": 16.121, + "eval_steps_per_second": 2.021, + "step": 2480 + }, + { + "entropy": 0.2523191448349457, + "epoch": 6.024140012070006, + "grad_norm": 0.7271217107772827, + "learning_rate": 0.00015407093752605022, + "loss": 0.20083463191986084, + "mean_token_accuracy": 0.9312780762647653, + "num_tokens": 5792908.0, + "step": 2500 + }, + { + "epoch": 6.024140012070006, + "eval_entropy": 0.3289327997337566, + "eval_loss": 0.8134235143661499, + "eval_mean_token_accuracy": 0.8248051414998729, + "eval_num_tokens": 5792908.0, + "eval_runtime": 89.1335, + "eval_samples_per_second": 15.931, + "eval_steps_per_second": 1.997, + "step": 2500 + }, + { + "entropy": 0.17906902078539133, + "epoch": 6.072420036210018, + "grad_norm": 0.6044061183929443, + "learning_rate": 0.00015096320664001312, + "loss": 0.14825894832611083, + "mean_token_accuracy": 0.9478232830762863, + "num_tokens": 5836969.0, + "step": 2520 + }, + { + "epoch": 6.072420036210018, + "eval_entropy": 0.34401263899347756, + "eval_loss": 0.7951938509941101, + "eval_mean_token_accuracy": 0.8232996959364816, + "eval_num_tokens": 5836969.0, + "eval_runtime": 88.4607, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 2520 + }, + { + "entropy": 0.1896738692186773, + "epoch": 6.12070006035003, + "grad_norm": 0.7623595595359802, + "learning_rate": 0.0001478659972997929, + "loss": 0.15062018632888793, + "mean_token_accuracy": 0.9476156957447529, + "num_tokens": 5880440.0, + "step": 2540 + }, + { + "epoch": 6.12070006035003, + "eval_entropy": 0.3361820410309213, + "eval_loss": 0.7982146739959717, + "eval_mean_token_accuracy": 0.825476693638255, + "eval_num_tokens": 5880440.0, + "eval_runtime": 89.0158, + "eval_samples_per_second": 15.952, + "eval_steps_per_second": 2.0, + "step": 2540 + }, + { + "entropy": 0.19159424304962158, + "epoch": 6.168980084490042, + "grad_norm": 0.7059116959571838, + "learning_rate": 0.00014478018597899632, + "loss": 0.15041557550430298, + "mean_token_accuracy": 0.946315186470747, + "num_tokens": 5924665.0, + "step": 2560 + }, + { + "epoch": 6.168980084490042, + "eval_entropy": 0.328647531987576, + "eval_loss": 0.8098915815353394, + "eval_mean_token_accuracy": 0.823520571328281, + "eval_num_tokens": 5924665.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 2560 + }, + { + "entropy": 0.1834640829823911, + "epoch": 6.217260108630055, + "grad_norm": 0.609506368637085, + "learning_rate": 0.00014170664592572544, + "loss": 0.1507703423500061, + "mean_token_accuracy": 0.947880481928587, + "num_tokens": 5971116.0, + "step": 2580 + }, + { + "epoch": 6.217260108630055, + "eval_entropy": 0.3346639998843161, + "eval_loss": 0.7952263355255127, + "eval_mean_token_accuracy": 0.8255967082602255, + "eval_num_tokens": 5971116.0, + "eval_runtime": 88.588, + "eval_samples_per_second": 16.029, + "eval_steps_per_second": 2.009, + "step": 2580 + }, + { + "entropy": 0.18807780891656875, + "epoch": 6.265540132770067, + "grad_norm": 0.782401442527771, + "learning_rate": 0.00013864624691545897, + "loss": 0.150755774974823, + "mean_token_accuracy": 0.9453216694295407, + "num_tokens": 6018684.0, + "step": 2600 + }, + { + "epoch": 6.265540132770067, + "eval_entropy": 0.321210315137097, + "eval_loss": 0.7982205152511597, + "eval_mean_token_accuracy": 0.826972935976607, + "eval_num_tokens": 6018684.0, + "eval_runtime": 88.0326, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 2600 + }, + { + "entropy": 0.18887900887057185, + "epoch": 6.3138201569100785, + "grad_norm": 0.7818743586540222, + "learning_rate": 0.00013559985500491572, + "loss": 0.1514918327331543, + "mean_token_accuracy": 0.9457836978137493, + "num_tokens": 6066954.0, + "step": 2620 + }, + { + "epoch": 6.3138201569100785, + "eval_entropy": 0.33611535657657665, + "eval_loss": 0.8096784353256226, + "eval_mean_token_accuracy": 0.8244635074326162, + "eval_num_tokens": 6066954.0, + "eval_runtime": 87.9857, + "eval_samples_per_second": 16.139, + "eval_steps_per_second": 2.023, + "step": 2620 + }, + { + "entropy": 0.17428901745006442, + "epoch": 6.36210018105009, + "grad_norm": 0.7160996198654175, + "learning_rate": 0.00013256833228697111, + "loss": 0.14635720252990722, + "mean_token_accuracy": 0.9494572594761849, + "num_tokens": 6117479.0, + "step": 2640 + }, + { + "epoch": 6.36210018105009, + "eval_entropy": 0.32968130741226537, + "eval_loss": 0.795514702796936, + "eval_mean_token_accuracy": 0.8256657645943459, + "eval_num_tokens": 6117479.0, + "eval_runtime": 88.9931, + "eval_samples_per_second": 15.956, + "eval_steps_per_second": 2.0, + "step": 2640 + }, + { + "entropy": 0.18460844503715634, + "epoch": 6.410380205190102, + "grad_norm": 0.8100566267967224, + "learning_rate": 0.0001295525366466948, + "loss": 0.1496778130531311, + "mean_token_accuracy": 0.9469681069254875, + "num_tokens": 6163103.0, + "step": 2660 + }, + { + "epoch": 6.410380205190102, + "eval_entropy": 0.32415712340159364, + "eval_loss": 0.8005954623222351, + "eval_mean_token_accuracy": 0.8246443308471294, + "eval_num_tokens": 6163103.0, + "eval_runtime": 88.7372, + "eval_samples_per_second": 16.002, + "eval_steps_per_second": 2.006, + "step": 2660 + }, + { + "entropy": 0.19344648774713277, + "epoch": 6.458660229330115, + "grad_norm": 0.6743079423904419, + "learning_rate": 0.0001265533215185796, + "loss": 0.1577553391456604, + "mean_token_accuracy": 0.944937615096569, + "num_tokens": 6210504.0, + "step": 2680 + }, + { + "epoch": 6.458660229330115, + "eval_entropy": 0.33167651705862433, + "eval_loss": 0.7990406155586243, + "eval_mean_token_accuracy": 0.824895450573289, + "eval_num_tokens": 6210504.0, + "eval_runtime": 88.7596, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.005, + "step": 2680 + }, + { + "entropy": 0.18892329484224318, + "epoch": 6.506940253470127, + "grad_norm": 0.7439920902252197, + "learning_rate": 0.00012357153564502942, + "loss": 0.15402607917785643, + "mean_token_accuracy": 0.9461932055652141, + "num_tokens": 6256168.0, + "step": 2700 + }, + { + "epoch": 6.506940253470127, + "eval_entropy": 0.3296281209822451, + "eval_loss": 0.7959091067314148, + "eval_mean_token_accuracy": 0.8255601418152284, + "eval_num_tokens": 6256168.0, + "eval_runtime": 88.4555, + "eval_samples_per_second": 16.053, + "eval_steps_per_second": 2.012, + "step": 2700 + }, + { + "entropy": 0.1912553665228188, + "epoch": 6.555220277610139, + "grad_norm": 0.6863725185394287, + "learning_rate": 0.00012060802283617536, + "loss": 0.15676106214523317, + "mean_token_accuracy": 0.9435188084840774, + "num_tokens": 6299642.0, + "step": 2720 + }, + { + "epoch": 6.555220277610139, + "eval_entropy": 0.33108900378594236, + "eval_loss": 0.7999242544174194, + "eval_mean_token_accuracy": 0.8262744124016065, + "eval_num_tokens": 6299642.0, + "eval_runtime": 87.2499, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 2720 + }, + { + "entropy": 0.19352400647476314, + "epoch": 6.603500301750151, + "grad_norm": 0.6504069566726685, + "learning_rate": 0.00011766362173108738, + "loss": 0.15693014860153198, + "mean_token_accuracy": 0.9453470788896083, + "num_tokens": 6344919.0, + "step": 2740 + }, + { + "epoch": 6.603500301750151, + "eval_entropy": 0.3351304212145591, + "eval_loss": 0.7975817918777466, + "eval_mean_token_accuracy": 0.8262755204452558, + "eval_num_tokens": 6344919.0, + "eval_runtime": 88.6027, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 2740 + }, + { + "entropy": 0.19650057442486285, + "epoch": 6.651780325890163, + "grad_norm": 0.9232484698295593, + "learning_rate": 0.00011473916556044933, + "loss": 0.15872747898101808, + "mean_token_accuracy": 0.9443749114871025, + "num_tokens": 6388338.0, + "step": 2760 + }, + { + "epoch": 6.651780325890163, + "eval_entropy": 0.31218746689598215, + "eval_loss": 0.8183822631835938, + "eval_mean_token_accuracy": 0.8263859531182921, + "eval_num_tokens": 6388338.0, + "eval_runtime": 89.2038, + "eval_samples_per_second": 15.919, + "eval_steps_per_second": 1.995, + "step": 2760 + }, + { + "entropy": 0.18859502710402012, + "epoch": 6.700060350030175, + "grad_norm": 0.8948624730110168, + "learning_rate": 0.0001118354819107644, + "loss": 0.15504695177078248, + "mean_token_accuracy": 0.9447060629725457, + "num_tokens": 6433425.0, + "step": 2780 + }, + { + "epoch": 6.700060350030175, + "eval_entropy": 0.3277170530865701, + "eval_loss": 0.800417423248291, + "eval_mean_token_accuracy": 0.826184545340163, + "eval_num_tokens": 6433425.0, + "eval_runtime": 89.1717, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.996, + "step": 2780 + }, + { + "entropy": 0.18859981009736657, + "epoch": 6.748340374170187, + "grad_norm": 0.5598214864730835, + "learning_rate": 0.00010895339249015836, + "loss": 0.1544385075569153, + "mean_token_accuracy": 0.9451094619929791, + "num_tokens": 6478249.0, + "step": 2800 + }, + { + "epoch": 6.748340374170187, + "eval_entropy": 0.3262680545449257, + "eval_loss": 0.7925727367401123, + "eval_mean_token_accuracy": 0.8272479052624006, + "eval_num_tokens": 6478249.0, + "eval_runtime": 88.3958, + "eval_samples_per_second": 16.064, + "eval_steps_per_second": 2.014, + "step": 2800 + }, + { + "entropy": 0.18286875914782286, + "epoch": 6.796620398310199, + "grad_norm": 0.7288182973861694, + "learning_rate": 0.00010609371289584521, + "loss": 0.15483447313308715, + "mean_token_accuracy": 0.946397764235735, + "num_tokens": 6526597.0, + "step": 2820 + }, + { + "epoch": 6.796620398310199, + "eval_entropy": 0.3231485774008076, + "eval_loss": 0.8040792942047119, + "eval_mean_token_accuracy": 0.8263571630702929, + "eval_num_tokens": 6526597.0, + "eval_runtime": 88.6613, + "eval_samples_per_second": 16.016, + "eval_steps_per_second": 2.008, + "step": 2820 + }, + { + "entropy": 0.1826595276594162, + "epoch": 6.844900422450211, + "grad_norm": 0.7522679567337036, + "learning_rate": 0.0001032572523833236, + "loss": 0.15428470373153685, + "mean_token_accuracy": 0.9460848644375801, + "num_tokens": 6573255.0, + "step": 2840 + }, + { + "epoch": 6.844900422450211, + "eval_entropy": 0.31538148190868037, + "eval_loss": 0.8011861443519592, + "eval_mean_token_accuracy": 0.8273241754328267, + "eval_num_tokens": 6573255.0, + "eval_runtime": 88.9392, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 2.001, + "step": 2840 + }, + { + "entropy": 0.18775210417807103, + "epoch": 6.8931804465902236, + "grad_norm": 0.9014021754264832, + "learning_rate": 0.00010044481363736635, + "loss": 0.15666497945785524, + "mean_token_accuracy": 0.9447238989174366, + "num_tokens": 6619167.0, + "step": 2860 + }, + { + "epoch": 6.8931804465902236, + "eval_entropy": 0.3193651750851213, + "eval_loss": 0.8041541576385498, + "eval_mean_token_accuracy": 0.8278855812013819, + "eval_num_tokens": 6619167.0, + "eval_runtime": 88.4814, + "eval_samples_per_second": 16.049, + "eval_steps_per_second": 2.012, + "step": 2860 + }, + { + "entropy": 0.17472777999937533, + "epoch": 6.941460470730235, + "grad_norm": 0.6994450092315674, + "learning_rate": 9.765719254487061e-05, + "loss": 0.14739950895309448, + "mean_token_accuracy": 0.9484775498509407, + "num_tokens": 6669111.0, + "step": 2880 + }, + { + "epoch": 6.941460470730235, + "eval_entropy": 0.314815216436145, + "eval_loss": 0.8106184601783752, + "eval_mean_token_accuracy": 0.8279167480683058, + "eval_num_tokens": 6669111.0, + "eval_runtime": 89.0502, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.999, + "step": 2880 + }, + { + "entropy": 0.17916967235505582, + "epoch": 6.989740494870247, + "grad_norm": 0.6007354259490967, + "learning_rate": 9.489517796963125e-05, + "loss": 0.1507383704185486, + "mean_token_accuracy": 0.9476396568119526, + "num_tokens": 6716225.0, + "step": 2900 + }, + { + "epoch": 6.989740494870247, + "eval_entropy": 0.32720738933997207, + "eval_loss": 0.7926715016365051, + "eval_mean_token_accuracy": 0.8280609012319801, + "eval_num_tokens": 6716225.0, + "eval_runtime": 88.0383, + "eval_samples_per_second": 16.129, + "eval_steps_per_second": 2.022, + "step": 2900 + }, + { + "entropy": 0.15926258372409002, + "epoch": 7.036210018105009, + "grad_norm": 0.44286999106407166, + "learning_rate": 9.21595515291015e-05, + "loss": 0.10761069059371949, + "mean_token_accuracy": 0.9592437008758644, + "num_tokens": 6762449.0, + "step": 2920 + }, + { + "epoch": 7.036210018105009, + "eval_entropy": 0.2828580670979586, + "eval_loss": 0.9056740999221802, + "eval_mean_token_accuracy": 0.8254911166228606, + "eval_num_tokens": 6762449.0, + "eval_runtime": 88.2719, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.016, + "step": 2920 + }, + { + "entropy": 0.11310737961903214, + "epoch": 7.084490042245021, + "grad_norm": 0.5048796534538269, + "learning_rate": 8.945108737320479e-05, + "loss": 0.09092960357666016, + "mean_token_accuracy": 0.9674679920077324, + "num_tokens": 6808754.0, + "step": 2940 + }, + { + "epoch": 7.084490042245021, + "eval_entropy": 0.2810762938153878, + "eval_loss": 0.8879074454307556, + "eval_mean_token_accuracy": 0.82501031709521, + "eval_num_tokens": 6808754.0, + "eval_runtime": 88.1129, + "eval_samples_per_second": 16.116, + "eval_steps_per_second": 2.02, + "step": 2940 + }, + { + "entropy": 0.12247815132141113, + "epoch": 7.132770066385033, + "grad_norm": 0.5650779604911804, + "learning_rate": 8.677055196525914e-05, + "loss": 0.09224110841751099, + "mean_token_accuracy": 0.9685524098575116, + "num_tokens": 6854766.0, + "step": 2960 + }, + { + "epoch": 7.132770066385033, + "eval_entropy": 0.27917667369494276, + "eval_loss": 0.895638644695282, + "eval_mean_token_accuracy": 0.8260931526676992, + "eval_num_tokens": 6854766.0, + "eval_runtime": 88.1172, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 2960 + }, + { + "entropy": 0.1326121488586068, + "epoch": 7.181050090525045, + "grad_norm": 0.4843117296695709, + "learning_rate": 8.411870386507724e-05, + "loss": 0.09537842869758606, + "mean_token_accuracy": 0.9645151920616627, + "num_tokens": 6898444.0, + "step": 2980 + }, + { + "epoch": 7.181050090525045, + "eval_entropy": 0.27999477783280813, + "eval_loss": 0.9031037092208862, + "eval_mean_token_accuracy": 0.8261882204018282, + "eval_num_tokens": 6898444.0, + "eval_runtime": 88.5602, + "eval_samples_per_second": 16.034, + "eval_steps_per_second": 2.01, + "step": 2980 + }, + { + "entropy": 0.1156751093454659, + "epoch": 7.229330114665057, + "grad_norm": 0.5297922492027283, + "learning_rate": 8.149629351430326e-05, + "loss": 0.09203402996063233, + "mean_token_accuracy": 0.9689733698964119, + "num_tokens": 6947106.0, + "step": 3000 + }, + { + "epoch": 7.229330114665057, + "eval_entropy": 0.2740225845508361, + "eval_loss": 0.8876440525054932, + "eval_mean_token_accuracy": 0.8265116857678703, + "eval_num_tokens": 6947106.0, + "eval_runtime": 87.7971, + "eval_samples_per_second": 16.174, + "eval_steps_per_second": 2.027, + "step": 3000 + }, + { + "entropy": 0.12116114404052496, + "epoch": 7.27761013880507, + "grad_norm": 0.5467398166656494, + "learning_rate": 7.890406302404618e-05, + "loss": 0.0933056652545929, + "mean_token_accuracy": 0.9676455594599247, + "num_tokens": 6992784.0, + "step": 3020 + }, + { + "epoch": 7.27761013880507, + "eval_entropy": 0.27238342793804876, + "eval_loss": 0.9166117310523987, + "eval_mean_token_accuracy": 0.825499015242866, + "eval_num_tokens": 6992784.0, + "eval_runtime": 88.3276, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 3020 + }, + { + "entropy": 0.11715119928121567, + "epoch": 7.325890162945082, + "grad_norm": 0.4976702332496643, + "learning_rate": 7.634274596487176e-05, + "loss": 0.09449659585952759, + "mean_token_accuracy": 0.966506478190422, + "num_tokens": 7040482.0, + "step": 3040 + }, + { + "epoch": 7.325890162945082, + "eval_entropy": 0.2788975556077582, + "eval_loss": 0.8833065629005432, + "eval_mean_token_accuracy": 0.8269920596915684, + "eval_num_tokens": 7040482.0, + "eval_runtime": 88.9016, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 2.002, + "step": 3040 + }, + { + "entropy": 0.12565911412239075, + "epoch": 7.3741701870850935, + "grad_norm": 0.5728679895401001, + "learning_rate": 7.381306715921025e-05, + "loss": 0.09626244902610778, + "mean_token_accuracy": 0.9661444149911403, + "num_tokens": 7086261.0, + "step": 3060 + }, + { + "epoch": 7.3741701870850935, + "eval_entropy": 0.2762492011939542, + "eval_loss": 0.8961160778999329, + "eval_mean_token_accuracy": 0.826369910092836, + "eval_num_tokens": 7086261.0, + "eval_runtime": 88.5204, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 3060 + }, + { + "entropy": 0.12258567921817302, + "epoch": 7.422450211225105, + "grad_norm": 0.468985915184021, + "learning_rate": 7.131574247624031e-05, + "loss": 0.09120266437530518, + "mean_token_accuracy": 0.9674938447773457, + "num_tokens": 7133247.0, + "step": 3080 + }, + { + "epoch": 7.422450211225105, + "eval_entropy": 0.2688512086366, + "eval_loss": 0.9048654437065125, + "eval_mean_token_accuracy": 0.8265582302982888, + "eval_num_tokens": 7133247.0, + "eval_runtime": 88.164, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 3080 + }, + { + "entropy": 0.12070536343380808, + "epoch": 7.470730235365117, + "grad_norm": 0.5310841798782349, + "learning_rate": 6.885147862930688e-05, + "loss": 0.09386247992515565, + "mean_token_accuracy": 0.96664222702384, + "num_tokens": 7177810.0, + "step": 3100 + }, + { + "epoch": 7.470730235365117, + "eval_entropy": 0.26289632874593305, + "eval_loss": 0.902837336063385, + "eval_mean_token_accuracy": 0.828052184554968, + "eval_num_tokens": 7177810.0, + "eval_runtime": 88.1201, + "eval_samples_per_second": 16.114, + "eval_steps_per_second": 2.02, + "step": 3100 + }, + { + "entropy": 0.11322665181942285, + "epoch": 7.51901025950513, + "grad_norm": 0.6846067905426025, + "learning_rate": 6.642097297592908e-05, + "loss": 0.08772538304328918, + "mean_token_accuracy": 0.9691362135112286, + "num_tokens": 7225302.0, + "step": 3120 + }, + { + "epoch": 7.51901025950513, + "eval_entropy": 0.2670605613776807, + "eval_loss": 0.9130566120147705, + "eval_mean_token_accuracy": 0.826366903741708, + "eval_num_tokens": 7225302.0, + "eval_runtime": 88.6035, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3120 + }, + { + "entropy": 0.10985926580615342, + "epoch": 7.567290283645142, + "grad_norm": 0.4799748361110687, + "learning_rate": 6.402491332045683e-05, + "loss": 0.08672296404838561, + "mean_token_accuracy": 0.9698824048042297, + "num_tokens": 7274881.0, + "step": 3140 + }, + { + "epoch": 7.567290283645142, + "eval_entropy": 0.26657010866015146, + "eval_loss": 0.9056380987167358, + "eval_mean_token_accuracy": 0.8272326461384806, + "eval_num_tokens": 7274881.0, + "eval_runtime": 88.2967, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3140 + }, + { + "entropy": 0.11890473761595785, + "epoch": 7.615570307785154, + "grad_norm": 0.4081912934780121, + "learning_rate": 6.166397771942987e-05, + "loss": 0.09396827220916748, + "mean_token_accuracy": 0.967512384802103, + "num_tokens": 7321163.0, + "step": 3160 + }, + { + "epoch": 7.615570307785154, + "eval_entropy": 0.26364776575833226, + "eval_loss": 0.9204733967781067, + "eval_mean_token_accuracy": 0.827419729714983, + "eval_num_tokens": 7321163.0, + "eval_runtime": 88.3441, + "eval_samples_per_second": 16.074, + "eval_steps_per_second": 2.015, + "step": 3160 + }, + { + "entropy": 0.12209134344011545, + "epoch": 7.663850331925166, + "grad_norm": 0.5159774422645569, + "learning_rate": 5.93388342896962e-05, + "loss": 0.09292978644371033, + "mean_token_accuracy": 0.9658421002328396, + "num_tokens": 7366217.0, + "step": 3180 + }, + { + "epoch": 7.663850331925166, + "eval_entropy": 0.2714110068725736, + "eval_loss": 0.9143092036247253, + "eval_mean_token_accuracy": 0.8262251099843657, + "eval_num_tokens": 7366217.0, + "eval_runtime": 87.9635, + "eval_samples_per_second": 16.143, + "eval_steps_per_second": 2.024, + "step": 3180 + }, + { + "entropy": 0.11955609126016498, + "epoch": 7.712130356065178, + "grad_norm": 0.7005976438522339, + "learning_rate": 5.705014101934252e-05, + "loss": 0.09319776892662049, + "mean_token_accuracy": 0.9674513377249241, + "num_tokens": 7410887.0, + "step": 3200 + }, + { + "epoch": 7.712130356065178, + "eval_entropy": 0.2626291513442993, + "eval_loss": 0.91884446144104, + "eval_mean_token_accuracy": 0.827563955207889, + "eval_num_tokens": 7410887.0, + "eval_runtime": 87.8849, + "eval_samples_per_second": 16.157, + "eval_steps_per_second": 2.025, + "step": 3200 + }, + { + "entropy": 0.11767532899975777, + "epoch": 7.76041038020519, + "grad_norm": 0.4675362706184387, + "learning_rate": 5.479854558149187e-05, + "loss": 0.09038087725639343, + "mean_token_accuracy": 0.9669680051505566, + "num_tokens": 7457578.0, + "step": 3220 + }, + { + "epoch": 7.76041038020519, + "eval_entropy": 0.26581037203582486, + "eval_loss": 0.9146883487701416, + "eval_mean_token_accuracy": 0.8270345812433222, + "eval_num_tokens": 7457578.0, + "eval_runtime": 88.4908, + "eval_samples_per_second": 16.047, + "eval_steps_per_second": 2.012, + "step": 3220 + }, + { + "entropy": 0.11383061073720455, + "epoch": 7.808690404345202, + "grad_norm": 0.541247546672821, + "learning_rate": 5.258468515101918e-05, + "loss": 0.08942405581474304, + "mean_token_accuracy": 0.968398705124855, + "num_tokens": 7505761.0, + "step": 3240 + }, + { + "epoch": 7.808690404345202, + "eval_entropy": 0.26687998960861997, + "eval_loss": 0.9037085175514221, + "eval_mean_token_accuracy": 0.8274977863504646, + "eval_num_tokens": 7505761.0, + "eval_runtime": 88.5163, + "eval_samples_per_second": 16.042, + "eval_steps_per_second": 2.011, + "step": 3240 + }, + { + "entropy": 0.12004058873280883, + "epoch": 7.856970428485214, + "grad_norm": 0.5289552211761475, + "learning_rate": 5.040918622423899e-05, + "loss": 0.09064805507659912, + "mean_token_accuracy": 0.9673330299556255, + "num_tokens": 7552557.0, + "step": 3260 + }, + { + "epoch": 7.856970428485214, + "eval_entropy": 0.26288379251622085, + "eval_loss": 0.9146178364753723, + "eval_mean_token_accuracy": 0.8276662448149049, + "eval_num_tokens": 7552557.0, + "eval_runtime": 88.0723, + "eval_samples_per_second": 16.123, + "eval_steps_per_second": 2.021, + "step": 3260 + }, + { + "entropy": 0.1180689456872642, + "epoch": 7.905250452625227, + "grad_norm": 0.4754861891269684, + "learning_rate": 4.827266444161377e-05, + "loss": 0.09402655363082886, + "mean_token_accuracy": 0.9663361787796021, + "num_tokens": 7596998.0, + "step": 3280 + }, + { + "epoch": 7.905250452625227, + "eval_entropy": 0.261690996922134, + "eval_loss": 0.9120186567306519, + "eval_mean_token_accuracy": 0.8278995015647974, + "eval_num_tokens": 7596998.0, + "eval_runtime": 88.6573, + "eval_samples_per_second": 16.017, + "eval_steps_per_second": 2.008, + "step": 3280 + }, + { + "entropy": 0.1162164019420743, + "epoch": 7.953530476765239, + "grad_norm": 0.6203398108482361, + "learning_rate": 4.61757244135355e-05, + "loss": 0.08832768201828003, + "mean_token_accuracy": 0.9694220684468746, + "num_tokens": 7643288.0, + "step": 3300 + }, + { + "epoch": 7.953530476765239, + "eval_entropy": 0.26158678129817664, + "eval_loss": 0.9301361441612244, + "eval_mean_token_accuracy": 0.8269603885291668, + "eval_num_tokens": 7643288.0, + "eval_runtime": 88.7064, + "eval_samples_per_second": 16.008, + "eval_steps_per_second": 2.007, + "step": 3300 + }, + { + "entropy": 0.10877202204489089, + "epoch": 8.0, + "grad_norm": 3.058673143386841, + "learning_rate": 4.411895954922763e-05, + "loss": 0.09159615635871887, + "mean_token_accuracy": 0.9686878834451947, + "num_tokens": 7688608.0, + "step": 3320 + }, + { + "epoch": 8.0, + "eval_entropy": 0.2590438057197614, + "eval_loss": 0.9262065887451172, + "eval_mean_token_accuracy": 0.8277404546067956, + "eval_num_tokens": 7688608.0, + "eval_runtime": 87.7557, + "eval_samples_per_second": 16.181, + "eval_steps_per_second": 2.028, + "step": 3320 + }, + { + "entropy": 0.09969092034734786, + "epoch": 8.048280024140013, + "grad_norm": 0.2561911642551422, + "learning_rate": 4.2102951888817644e-05, + "loss": 0.07228735685348511, + "mean_token_accuracy": 0.9743556551635265, + "num_tokens": 7732856.0, + "step": 3340 + }, + { + "epoch": 8.048280024140013, + "eval_entropy": 0.2462534454933713, + "eval_loss": 0.9755983352661133, + "eval_mean_token_accuracy": 0.827510209565752, + "eval_num_tokens": 7732856.0, + "eval_runtime": 88.0297, + "eval_samples_per_second": 16.131, + "eval_steps_per_second": 2.022, + "step": 3340 + }, + { + "entropy": 0.09477624730207027, + "epoch": 8.096560048280024, + "grad_norm": 0.3670356571674347, + "learning_rate": 4.012827193862633e-05, + "loss": 0.0686036467552185, + "mean_token_accuracy": 0.9743670664727688, + "num_tokens": 7778585.0, + "step": 3360 + }, + { + "epoch": 8.096560048280024, + "eval_entropy": 0.2440882951356052, + "eval_loss": 1.0118423700332642, + "eval_mean_token_accuracy": 0.8271241070849172, + "eval_num_tokens": 7778585.0, + "eval_runtime": 88.1364, + "eval_samples_per_second": 16.111, + "eval_steps_per_second": 2.02, + "step": 3360 + }, + { + "entropy": 0.09417980071157217, + "epoch": 8.144840072420036, + "grad_norm": 0.5785111784934998, + "learning_rate": 3.819547850972133e-05, + "loss": 0.07100698947906495, + "mean_token_accuracy": 0.9737804099917412, + "num_tokens": 7824287.0, + "step": 3380 + }, + { + "epoch": 8.144840072420036, + "eval_entropy": 0.24603172860453637, + "eval_loss": 1.0021991729736328, + "eval_mean_token_accuracy": 0.827162122793412, + "eval_num_tokens": 7824287.0, + "eval_runtime": 88.4534, + "eval_samples_per_second": 16.054, + "eval_steps_per_second": 2.012, + "step": 3380 + }, + { + "entropy": 0.087222247896716, + "epoch": 8.193120096560047, + "grad_norm": 0.44848504662513733, + "learning_rate": 3.6305118559780393e-05, + "loss": 0.06325234174728393, + "mean_token_accuracy": 0.9769335232675076, + "num_tokens": 7874784.0, + "step": 3400 + }, + { + "epoch": 8.193120096560047, + "eval_entropy": 0.24544863905129807, + "eval_loss": 1.005008339881897, + "eval_mean_token_accuracy": 0.8273035240976998, + "eval_num_tokens": 7874784.0, + "eval_runtime": 88.6737, + "eval_samples_per_second": 16.014, + "eval_steps_per_second": 2.007, + "step": 3400 + }, + { + "entropy": 0.09037275062873959, + "epoch": 8.24140012070006, + "grad_norm": 0.23529155552387238, + "learning_rate": 3.4457727038308435e-05, + "loss": 0.06589569449424744, + "mean_token_accuracy": 0.9751470290124417, + "num_tokens": 7925240.0, + "step": 3420 + }, + { + "epoch": 8.24140012070006, + "eval_entropy": 0.24203423494368456, + "eval_loss": 1.0052824020385742, + "eval_mean_token_accuracy": 0.8275575503874361, + "eval_num_tokens": 7925240.0, + "eval_runtime": 88.3486, + "eval_samples_per_second": 16.073, + "eval_steps_per_second": 2.015, + "step": 3420 + }, + { + "entropy": 0.10373208015225828, + "epoch": 8.289680144840073, + "grad_norm": 0.24796408414840698, + "learning_rate": 3.2653826735253594e-05, + "loss": 0.07714771628379821, + "mean_token_accuracy": 0.9722891598939896, + "num_tokens": 7966685.0, + "step": 3440 + }, + { + "epoch": 8.289680144840073, + "eval_entropy": 0.23461157050025597, + "eval_loss": 1.012108325958252, + "eval_mean_token_accuracy": 0.82825900564033, + "eval_num_tokens": 7966685.0, + "eval_runtime": 88.1018, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 3440 + }, + { + "entropy": 0.08967954274266958, + "epoch": 8.337960168980084, + "grad_norm": 0.5314674973487854, + "learning_rate": 3.08939281330635e-05, + "loss": 0.06746266484260559, + "mean_token_accuracy": 0.9753133699297905, + "num_tokens": 8013656.0, + "step": 3460 + }, + { + "epoch": 8.337960168980084, + "eval_entropy": 0.23781998589467468, + "eval_loss": 1.0119913816452026, + "eval_mean_token_accuracy": 0.8273287157664139, + "eval_num_tokens": 8013656.0, + "eval_runtime": 88.6038, + "eval_samples_per_second": 16.026, + "eval_steps_per_second": 2.009, + "step": 3460 + }, + { + "entropy": 0.09280927330255509, + "epoch": 8.386240193120097, + "grad_norm": 0.30658936500549316, + "learning_rate": 2.9178529262224946e-05, + "loss": 0.06936421990394592, + "mean_token_accuracy": 0.9742105580866337, + "num_tokens": 8061108.0, + "step": 3480 + }, + { + "epoch": 8.386240193120097, + "eval_entropy": 0.23672426734747512, + "eval_loss": 1.0162041187286377, + "eval_mean_token_accuracy": 0.8278394281194451, + "eval_num_tokens": 8061108.0, + "eval_runtime": 88.6015, + "eval_samples_per_second": 16.027, + "eval_steps_per_second": 2.009, + "step": 3480 + }, + { + "entropy": 0.09195122267119586, + "epoch": 8.43452021726011, + "grad_norm": 0.24512454867362976, + "learning_rate": 2.7508115560327256e-05, + "loss": 0.06996064782142639, + "mean_token_accuracy": 0.974104854464531, + "num_tokens": 8106924.0, + "step": 3500 + }, + { + "epoch": 8.43452021726011, + "eval_entropy": 0.23758245828781235, + "eval_loss": 1.0157747268676758, + "eval_mean_token_accuracy": 0.8278501579600773, + "eval_num_tokens": 8106924.0, + "eval_runtime": 88.5678, + "eval_samples_per_second": 16.033, + "eval_steps_per_second": 2.01, + "step": 3500 + }, + { + "entropy": 0.09518477590754629, + "epoch": 8.48280024140012, + "grad_norm": 0.2373228371143341, + "learning_rate": 2.5883159734688868e-05, + "loss": 0.06832797527313232, + "mean_token_accuracy": 0.9743806682527065, + "num_tokens": 8153070.0, + "step": 3520 + }, + { + "epoch": 8.48280024140012, + "eval_entropy": 0.2379308074210467, + "eval_loss": 1.0180530548095703, + "eval_mean_token_accuracy": 0.8282477052024241, + "eval_num_tokens": 8153070.0, + "eval_runtime": 88.4651, + "eval_samples_per_second": 16.052, + "eval_steps_per_second": 2.012, + "step": 3520 + }, + { + "entropy": 0.0906269280705601, + "epoch": 8.531080265540133, + "grad_norm": 0.37602657079696655, + "learning_rate": 2.4304121628587173e-05, + "loss": 0.06921588778495788, + "mean_token_accuracy": 0.9745571479201317, + "num_tokens": 8200066.0, + "step": 3540 + }, + { + "epoch": 8.531080265540133, + "eval_entropy": 0.2357490769263064, + "eval_loss": 1.017139196395874, + "eval_mean_token_accuracy": 0.828713178299786, + "eval_num_tokens": 8200066.0, + "eval_runtime": 88.6424, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3540 + }, + { + "entropy": 0.09273334196768701, + "epoch": 8.579360289680144, + "grad_norm": 0.2978838086128235, + "learning_rate": 2.277144809112794e-05, + "loss": 0.06970887780189514, + "mean_token_accuracy": 0.9751374177634716, + "num_tokens": 8246157.0, + "step": 3560 + }, + { + "epoch": 8.579360289680144, + "eval_entropy": 0.23590933138065123, + "eval_loss": 1.019231915473938, + "eval_mean_token_accuracy": 0.8279163412163767, + "eval_num_tokens": 8246157.0, + "eval_runtime": 88.2691, + "eval_samples_per_second": 16.087, + "eval_steps_per_second": 2.017, + "step": 3560 + }, + { + "entropy": 0.09854201921261847, + "epoch": 8.627640313820157, + "grad_norm": 0.5381243228912354, + "learning_rate": 2.1285572850792413e-05, + "loss": 0.07123501300811767, + "mean_token_accuracy": 0.9723988175392151, + "num_tokens": 8291752.0, + "step": 3580 + }, + { + "epoch": 8.627640313820157, + "eval_entropy": 0.23592024949494372, + "eval_loss": 1.020250678062439, + "eval_mean_token_accuracy": 0.8282466226079491, + "eval_num_tokens": 8291752.0, + "eval_runtime": 87.8939, + "eval_samples_per_second": 16.156, + "eval_steps_per_second": 2.025, + "step": 3580 + }, + { + "entropy": 0.09092000788077712, + "epoch": 8.67592033796017, + "grad_norm": 0.29089561104774475, + "learning_rate": 1.9846916392697493e-05, + "loss": 0.06982720494270325, + "mean_token_accuracy": 0.9749995484948158, + "num_tokens": 8337651.0, + "step": 3600 + }, + { + "epoch": 8.67592033796017, + "eval_entropy": 0.23658913382318583, + "eval_loss": 1.019862413406372, + "eval_mean_token_accuracy": 0.8280127842104836, + "eval_num_tokens": 8337651.0, + "eval_runtime": 88.2855, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 3600 + }, + { + "entropy": 0.08708424470387399, + "epoch": 8.72420036210018, + "grad_norm": 0.29904839396476746, + "learning_rate": 1.8455885839603106e-05, + "loss": 0.06801370978355407, + "mean_token_accuracy": 0.9755801670253277, + "num_tokens": 8385330.0, + "step": 3620 + }, + { + "epoch": 8.72420036210018, + "eval_entropy": 0.23627035771862845, + "eval_loss": 1.0204569101333618, + "eval_mean_token_accuracy": 0.8279967894045155, + "eval_num_tokens": 8385330.0, + "eval_runtime": 88.1753, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 3620 + }, + { + "entropy": 0.0916255566291511, + "epoch": 8.772480386240193, + "grad_norm": 0.20571033656597137, + "learning_rate": 1.7112874836701502e-05, + "loss": 0.0692249894142151, + "mean_token_accuracy": 0.9745148062705994, + "num_tokens": 8432134.0, + "step": 3640 + }, + { + "epoch": 8.772480386240193, + "eval_entropy": 0.2340821772813797, + "eval_loss": 1.0212821960449219, + "eval_mean_token_accuracy": 0.828373622358515, + "eval_num_tokens": 8432134.0, + "eval_runtime": 87.2518, + "eval_samples_per_second": 16.275, + "eval_steps_per_second": 2.04, + "step": 3640 + }, + { + "entropy": 0.0926868049427867, + "epoch": 8.820760410380204, + "grad_norm": 0.2618265450000763, + "learning_rate": 1.5818263440220203e-05, + "loss": 0.07338647246360779, + "mean_token_accuracy": 0.9724708944559097, + "num_tokens": 8476758.0, + "step": 3660 + }, + { + "epoch": 8.820760410380204, + "eval_entropy": 0.23637074575330433, + "eval_loss": 1.0186725854873657, + "eval_mean_token_accuracy": 0.8277707605549459, + "eval_num_tokens": 8476758.0, + "eval_runtime": 88.4695, + "eval_samples_per_second": 16.051, + "eval_steps_per_second": 2.012, + "step": 3660 + }, + { + "entropy": 0.09175782897509635, + "epoch": 8.869040434520217, + "grad_norm": 0.2889852821826935, + "learning_rate": 1.4572418009870604e-05, + "loss": 0.07066041231155396, + "mean_token_accuracy": 0.9725673109292984, + "num_tokens": 8523294.0, + "step": 3680 + }, + { + "epoch": 8.869040434520217, + "eval_entropy": 0.23945164404223473, + "eval_loss": 1.0145231485366821, + "eval_mean_token_accuracy": 0.8281202523895864, + "eval_num_tokens": 8523294.0, + "eval_runtime": 88.368, + "eval_samples_per_second": 16.069, + "eval_steps_per_second": 2.014, + "step": 3680 + }, + { + "entropy": 0.09265611860901117, + "epoch": 8.91732045866023, + "grad_norm": 0.41092950105667114, + "learning_rate": 1.3375691105172625e-05, + "loss": 0.06975027322769164, + "mean_token_accuracy": 0.974636297672987, + "num_tokens": 8570358.0, + "step": 3700 + }, + { + "epoch": 8.91732045866023, + "eval_entropy": 0.239588919901446, + "eval_loss": 1.014059066772461, + "eval_mean_token_accuracy": 0.828028041660116, + "eval_num_tokens": 8570358.0, + "eval_runtime": 88.1039, + "eval_samples_per_second": 16.117, + "eval_steps_per_second": 2.02, + "step": 3700 + }, + { + "entropy": 0.0896465003490448, + "epoch": 8.965600482800241, + "grad_norm": 0.24000254273414612, + "learning_rate": 1.2228421385684305e-05, + "loss": 0.06743953824043274, + "mean_token_accuracy": 0.974006575345993, + "num_tokens": 8618246.0, + "step": 3720 + }, + { + "epoch": 8.965600482800241, + "eval_entropy": 0.2390461369846644, + "eval_loss": 1.011997938156128, + "eval_mean_token_accuracy": 0.8284533211354459, + "eval_num_tokens": 8618246.0, + "eval_runtime": 88.6202, + "eval_samples_per_second": 16.023, + "eval_steps_per_second": 2.009, + "step": 3720 + }, + { + "entropy": 0.09575109251520851, + "epoch": 9.012070006035003, + "grad_norm": 0.18088576197624207, + "learning_rate": 1.1130933515165429e-05, + "loss": 0.07295305132865906, + "mean_token_accuracy": 0.9739722857227573, + "num_tokens": 8661177.0, + "step": 3740 + }, + { + "epoch": 9.012070006035003, + "eval_entropy": 0.23728882387447892, + "eval_loss": 1.0134038925170898, + "eval_mean_token_accuracy": 0.8286508951294288, + "eval_num_tokens": 8661177.0, + "eval_runtime": 88.6434, + "eval_samples_per_second": 16.019, + "eval_steps_per_second": 2.008, + "step": 3740 + }, + { + "entropy": 0.08883201805874705, + "epoch": 9.060350030175016, + "grad_norm": 0.23120898008346558, + "learning_rate": 1.008353806970132e-05, + "loss": 0.06326142549514771, + "mean_token_accuracy": 0.9780020996928215, + "num_tokens": 8707602.0, + "step": 3760 + }, + { + "epoch": 9.060350030175016, + "eval_entropy": 0.23416905331142832, + "eval_loss": 1.0284100770950317, + "eval_mean_token_accuracy": 0.8284083213029283, + "eval_num_tokens": 8707602.0, + "eval_runtime": 88.2933, + "eval_samples_per_second": 16.083, + "eval_steps_per_second": 2.016, + "step": 3760 + }, + { + "entropy": 0.08861468276008963, + "epoch": 9.108630054315027, + "grad_norm": 0.17277656495571136, + "learning_rate": 9.086531449813489e-06, + "loss": 0.06727416515350342, + "mean_token_accuracy": 0.9760390736162663, + "num_tokens": 8751287.0, + "step": 3780 + }, + { + "epoch": 9.108630054315027, + "eval_entropy": 0.23370317386442355, + "eval_loss": 1.0381091833114624, + "eval_mean_token_accuracy": 0.8282668178670862, + "eval_num_tokens": 8751287.0, + "eval_runtime": 88.5738, + "eval_samples_per_second": 16.032, + "eval_steps_per_second": 2.01, + "step": 3780 + }, + { + "entropy": 0.09032954541034996, + "epoch": 9.15691007845504, + "grad_norm": 0.19481085240840912, + "learning_rate": 8.140195796581981e-06, + "loss": 0.06117786169052124, + "mean_token_accuracy": 0.9764454193413258, + "num_tokens": 8799982.0, + "step": 3800 + }, + { + "epoch": 9.15691007845504, + "eval_entropy": 0.23215936609868254, + "eval_loss": 1.0467767715454102, + "eval_mean_token_accuracy": 0.828405868806196, + "eval_num_tokens": 8799982.0, + "eval_runtime": 87.9551, + "eval_samples_per_second": 16.145, + "eval_steps_per_second": 2.024, + "step": 3800 + }, + { + "entropy": 0.08824449330568314, + "epoch": 9.20519010259505, + "grad_norm": 0.20382793247699738, + "learning_rate": 7.2447989118025455e-06, + "loss": 0.06422553658485412, + "mean_token_accuracy": 0.9763121999800205, + "num_tokens": 8845536.0, + "step": 3820 + }, + { + "epoch": 9.20519010259505, + "eval_entropy": 0.23169661472352704, + "eval_loss": 1.0529043674468994, + "eval_mean_token_accuracy": 0.8282025610463003, + "eval_num_tokens": 8845536.0, + "eval_runtime": 88.5548, + "eval_samples_per_second": 16.035, + "eval_steps_per_second": 2.01, + "step": 3820 + }, + { + "entropy": 0.07768499720841646, + "epoch": 9.253470126735063, + "grad_norm": 0.11727919429540634, + "learning_rate": 6.400594182202084e-06, + "loss": 0.057279336452484134, + "mean_token_accuracy": 0.9795166745781898, + "num_tokens": 8896053.0, + "step": 3840 + }, + { + "epoch": 9.253470126735063, + "eval_entropy": 0.2301936373114586, + "eval_loss": 1.0576049089431763, + "eval_mean_token_accuracy": 0.8283417489421502, + "eval_num_tokens": 8896053.0, + "eval_runtime": 88.7854, + "eval_samples_per_second": 15.994, + "eval_steps_per_second": 2.005, + "step": 3840 + }, + { + "entropy": 0.09015200780704617, + "epoch": 9.301750150875076, + "grad_norm": 0.2089058756828308, + "learning_rate": 5.6078205077330705e-06, + "loss": 0.06626194715499878, + "mean_token_accuracy": 0.9747506938874722, + "num_tokens": 8940591.0, + "step": 3860 + }, + { + "epoch": 9.301750150875076, + "eval_entropy": 0.23024900676159377, + "eval_loss": 1.0599786043167114, + "eval_mean_token_accuracy": 0.8283051915383071, + "eval_num_tokens": 8940591.0, + "eval_runtime": 88.2963, + "eval_samples_per_second": 16.082, + "eval_steps_per_second": 2.016, + "step": 3860 + }, + { + "entropy": 0.08484094133600592, + "epoch": 9.350030175015087, + "grad_norm": 0.21646778285503387, + "learning_rate": 4.866702233967785e-06, + "loss": 0.05998039245605469, + "mean_token_accuracy": 0.9771868668496608, + "num_tokens": 8989035.0, + "step": 3880 + }, + { + "epoch": 9.350030175015087, + "eval_entropy": 0.2300723305578982, + "eval_loss": 1.0633587837219238, + "eval_mean_token_accuracy": 0.828371500701047, + "eval_num_tokens": 8989035.0, + "eval_runtime": 88.0233, + "eval_samples_per_second": 16.132, + "eval_steps_per_second": 2.022, + "step": 3880 + }, + { + "entropy": 0.08905019680969417, + "epoch": 9.3983101991551, + "grad_norm": 0.21842406690120697, + "learning_rate": 4.177449088611095e-06, + "loss": 0.06666865348815917, + "mean_token_accuracy": 0.9753445640206337, + "num_tokens": 9033383.0, + "step": 3900 + }, + { + "epoch": 9.3983101991551, + "eval_entropy": 0.2295504841911659, + "eval_loss": 1.0662461519241333, + "eval_mean_token_accuracy": 0.8284122297603093, + "eval_num_tokens": 9033383.0, + "eval_runtime": 88.5525, + "eval_samples_per_second": 16.036, + "eval_steps_per_second": 2.01, + "step": 3900 + }, + { + "entropy": 0.08582521872594953, + "epoch": 9.446590223295111, + "grad_norm": 0.2000240683555603, + "learning_rate": 3.540256122150088e-06, + "loss": 0.06327944993972778, + "mean_token_accuracy": 0.9765432856976985, + "num_tokens": 9079672.0, + "step": 3920 + }, + { + "epoch": 9.446590223295111, + "eval_entropy": 0.2297678625818049, + "eval_loss": 1.0676169395446777, + "eval_mean_token_accuracy": 0.8283703879693921, + "eval_num_tokens": 9079672.0, + "eval_runtime": 87.6897, + "eval_samples_per_second": 16.193, + "eval_steps_per_second": 2.03, + "step": 3920 + }, + { + "entropy": 0.09261773955076932, + "epoch": 9.494870247435124, + "grad_norm": 0.19104281067848206, + "learning_rate": 2.955303652656991e-06, + "loss": 0.06111966967582703, + "mean_token_accuracy": 0.9738784030079841, + "num_tokens": 9127647.0, + "step": 3940 + }, + { + "epoch": 9.494870247435124, + "eval_entropy": 0.22986975881490815, + "eval_loss": 1.0687925815582275, + "eval_mean_token_accuracy": 0.8282996858103892, + "eval_num_tokens": 9127647.0, + "eval_runtime": 88.2224, + "eval_samples_per_second": 16.096, + "eval_steps_per_second": 2.018, + "step": 3940 + }, + { + "entropy": 0.08347254800610245, + "epoch": 9.543150271575136, + "grad_norm": 0.18671369552612305, + "learning_rate": 2.422757214761356e-06, + "loss": 0.06384263038635254, + "mean_token_accuracy": 0.9770128890872002, + "num_tokens": 9172587.0, + "step": 3960 + }, + { + "epoch": 9.543150271575136, + "eval_entropy": 0.22975517851248217, + "eval_loss": 1.0701013803482056, + "eval_mean_token_accuracy": 0.8282244285840666, + "eval_num_tokens": 9172587.0, + "eval_runtime": 88.5794, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 3960 + }, + { + "entropy": 0.08136763009242713, + "epoch": 9.591430295715147, + "grad_norm": 0.24811454117298126, + "learning_rate": 1.942767512805673e-06, + "loss": 0.06044899821281433, + "mean_token_accuracy": 0.9776685133576393, + "num_tokens": 9219278.0, + "step": 3980 + }, + { + "epoch": 9.591430295715147, + "eval_entropy": 0.22938149347064202, + "eval_loss": 1.0711463689804077, + "eval_mean_token_accuracy": 0.8282721410976367, + "eval_num_tokens": 9219278.0, + "eval_runtime": 88.4978, + "eval_samples_per_second": 16.046, + "eval_steps_per_second": 2.011, + "step": 3980 + }, + { + "entropy": 0.09432941288687288, + "epoch": 9.63971031985516, + "grad_norm": 0.30733999609947205, + "learning_rate": 1.515470378197889e-06, + "loss": 0.0672213613986969, + "mean_token_accuracy": 0.9728612303733826, + "num_tokens": 9262346.0, + "step": 4000 + }, + { + "epoch": 9.63971031985516, + "eval_entropy": 0.22936245958121976, + "eval_loss": 1.071343183517456, + "eval_mean_token_accuracy": 0.8282827025049189, + "eval_num_tokens": 9262346.0, + "eval_runtime": 88.4428, + "eval_samples_per_second": 16.056, + "eval_steps_per_second": 2.013, + "step": 4000 + }, + { + "entropy": 0.08287148931995034, + "epoch": 9.687990343995171, + "grad_norm": 0.1976361870765686, + "learning_rate": 1.1409867309726256e-06, + "loss": 0.06318551301956177, + "mean_token_accuracy": 0.9770804084837437, + "num_tokens": 9309622.0, + "step": 4020 + }, + { + "epoch": 9.687990343995171, + "eval_entropy": 0.22929051920269314, + "eval_loss": 1.0711324214935303, + "eval_mean_token_accuracy": 0.8281597297513084, + "eval_num_tokens": 9309622.0, + "eval_runtime": 88.5243, + "eval_samples_per_second": 16.041, + "eval_steps_per_second": 2.011, + "step": 4020 + }, + { + "entropy": 0.0907150611979887, + "epoch": 9.736270368135184, + "grad_norm": 0.16192017495632172, + "learning_rate": 8.194225455723828e-07, + "loss": 0.06589602828025817, + "mean_token_accuracy": 0.9738550461828709, + "num_tokens": 9354549.0, + "step": 4040 + }, + { + "epoch": 9.736270368135184, + "eval_entropy": 0.22913936391640244, + "eval_loss": 1.0715173482894897, + "eval_mean_token_accuracy": 0.8281301544623428, + "eval_num_tokens": 9354549.0, + "eval_runtime": 88.875, + "eval_samples_per_second": 15.978, + "eval_steps_per_second": 2.003, + "step": 4040 + }, + { + "entropy": 0.09003224167972804, + "epoch": 9.784550392275197, + "grad_norm": 0.2092711478471756, + "learning_rate": 5.508688208578523e-07, + "loss": 0.06655729413032532, + "mean_token_accuracy": 0.9750426560640335, + "num_tokens": 9399394.0, + "step": 4060 + }, + { + "epoch": 9.784550392275197, + "eval_entropy": 0.2291239777140403, + "eval_loss": 1.0715563297271729, + "eval_mean_token_accuracy": 0.8281808595978812, + "eval_num_tokens": 9399394.0, + "eval_runtime": 88.4328, + "eval_samples_per_second": 16.057, + "eval_steps_per_second": 2.013, + "step": 4060 + }, + { + "entropy": 0.08719871481880545, + "epoch": 9.832830416415208, + "grad_norm": 0.17966455221176147, + "learning_rate": 3.3540155435645076e-07, + "loss": 0.05917760729789734, + "mean_token_accuracy": 0.9752349570393563, + "num_tokens": 9449483.0, + "step": 4080 + }, + { + "epoch": 9.832830416415208, + "eval_entropy": 0.2291418021816886, + "eval_loss": 1.0714553594589233, + "eval_mean_token_accuracy": 0.8281870403986299, + "eval_num_tokens": 9449483.0, + "eval_runtime": 88.2612, + "eval_samples_per_second": 16.089, + "eval_steps_per_second": 2.017, + "step": 4080 + }, + { + "entropy": 0.07887464743107557, + "epoch": 9.88111044055522, + "grad_norm": 0.4397202134132385, + "learning_rate": 1.7308172075587924e-07, + "loss": 0.060457843542099, + "mean_token_accuracy": 0.9779011741280556, + "num_tokens": 9497731.0, + "step": 4100 + }, + { + "epoch": 9.88111044055522, + "eval_entropy": 0.2292038949855258, + "eval_loss": 1.0717124938964844, + "eval_mean_token_accuracy": 0.8282261353530241, + "eval_num_tokens": 9497731.0, + "eval_runtime": 88.5793, + "eval_samples_per_second": 16.031, + "eval_steps_per_second": 2.009, + "step": 4100 + }, + { + "entropy": 0.07985925199463964, + "epoch": 9.929390464695233, + "grad_norm": 0.2129203975200653, + "learning_rate": 6.395525464895752e-08, + "loss": 0.05666370391845703, + "mean_token_accuracy": 0.9778168581426143, + "num_tokens": 9548917.0, + "step": 4120 + }, + { + "epoch": 9.929390464695233, + "eval_entropy": 0.22915430601393239, + "eval_loss": 1.0715631246566772, + "eval_mean_token_accuracy": 0.8282323436120923, + "eval_num_tokens": 9548917.0, + "eval_runtime": 88.4991, + "eval_samples_per_second": 16.045, + "eval_steps_per_second": 2.011, + "step": 4120 + }, + { + "entropy": 0.08802500045858323, + "epoch": 9.977670488835244, + "grad_norm": 0.18367069959640503, + "learning_rate": 8.053037534806845e-09, + "loss": 0.06633861660957337, + "mean_token_accuracy": 0.9749571368098259, + "num_tokens": 9592427.0, + "step": 4140 + }, + { + "epoch": 9.977670488835244, + "eval_entropy": 0.22921692956699413, + "eval_loss": 1.0715234279632568, + "eval_mean_token_accuracy": 0.828055245822735, + "eval_num_tokens": 9592427.0, + "eval_runtime": 88.1869, + "eval_samples_per_second": 16.102, + "eval_steps_per_second": 2.018, + "step": 4140 + }, + { + "epoch": 10.0, + "eval_entropy": 0.229176854986823, + "eval_loss": 1.0716373920440674, + "eval_mean_token_accuracy": 0.828094540352232, + "eval_num_tokens": 9610760.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 4150 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 4.065114277436621e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d2b2328b64f6d67d1272c35f48b5846a170f2b51 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-420/trainer_state.json @@ -0,0 +1,475 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.012070006035003, + "eval_steps": 20, + "global_step": 420, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.121406190398874e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6e24a358efbd1aa845c333f7617738640438c8d6 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-440/trainer_state.json @@ -0,0 +1,496 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.060350030175015, + "eval_steps": 20, + "global_step": 440, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.335126423740621e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7ce3be5f5d5bbae25b20543d0a82f684c4b36966 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-460/trainer_state.json @@ -0,0 +1,517 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.1086300543150271, + "eval_steps": 20, + "global_step": 460, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.52529392245248e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..52acd0befc0359dec4e21771a0ce5d6ad078f6fe --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-480/trainer_state.json @@ -0,0 +1,538 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.1569100784550392, + "eval_steps": 20, + "global_step": 480, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.726057958755738e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e7240a697ab1749665d8e524b13c36265f6e8247 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-500/trainer_state.json @@ -0,0 +1,559 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.2051901025950513, + "eval_steps": 20, + "global_step": 500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.911927193047245e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..78b9aa19f90413387eeb00263fa6845c460482f1 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-520/trainer_state.json @@ -0,0 +1,580 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.2534701267350634, + "eval_steps": 20, + "global_step": 520, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.114147376072499e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ae395697c51afa9ac346eaed8de4fb2f6dbd7c58 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-540/trainer_state.json @@ -0,0 +1,601 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.3017501508750755, + "eval_steps": 20, + "global_step": 540, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.303253466631578e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2257cf2a5a7def11a8199885ce490e09ed6e37a1 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-560/trainer_state.json @@ -0,0 +1,622 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.3500301750150876, + "eval_steps": 20, + "global_step": 560, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.499473623404749e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f1fc8c1e63ac62b33482d1bd2a36c4b00c43498b --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-580/trainer_state.json @@ -0,0 +1,643 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.3983101991550995, + "eval_steps": 20, + "global_step": 580, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.669246296040448e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8c4bdf64a9e0c19d890d83819f8260cdd7fa01ca --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-60/trainer_state.json @@ -0,0 +1,97 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.14484007242003621, + "eval_steps": 20, + "global_step": 60, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5955464653602816.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..81d34d2880beb4477f908e688186a2c217b1b145 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-600/trainer_state.json @@ -0,0 +1,664 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.4465902232951118, + "eval_steps": 20, + "global_step": 600, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.868799800731443e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6ec6bd6f87fcb72db191f80dcc638ca183af6e34 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-620/trainer_state.json @@ -0,0 +1,685 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.4948702474351236, + "eval_steps": 20, + "global_step": 620, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.069125238624461e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a76c23296ecdb29b6853916df5dca6d8e4957315 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-640/trainer_state.json @@ -0,0 +1,706 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.5431502715751357, + "eval_steps": 20, + "global_step": 640, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.270862963398451e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d586e72c495c90c3fd41e41b80265793bfb6b00a --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-660/trainer_state.json @@ -0,0 +1,727 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.5914302957151478, + "eval_steps": 20, + "global_step": 660, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.456188335661261e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..77b58bbe2b8d8f11b447c057dc02b2b411840a24 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-680/trainer_state.json @@ -0,0 +1,748 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.63971031985516, + "eval_steps": 20, + "global_step": 680, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.649496198990438e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8965145e7ee8bc55f73478b59ec741e999cdd020 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-700/trainer_state.json @@ -0,0 +1,769 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.687990343995172, + "eval_steps": 20, + "global_step": 700, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 6.850146199707034e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5c845d689c7be30745b8742cfdd4b9e4bf9a54c7 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-720/trainer_state.json @@ -0,0 +1,790 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.736270368135184, + "eval_steps": 20, + "global_step": 720, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.0671910089984e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d9afda6e4a14bc65d58855e3f2398646b3dead2f --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-740/trainer_state.json @@ -0,0 +1,811 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.7845503922751962, + "eval_steps": 20, + "global_step": 740, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.25684973355438e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..9315ac75cbed0212ad995580a7ca62e17c871d38 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-760/trainer_state.json @@ -0,0 +1,832 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.832830416415208, + "eval_steps": 20, + "global_step": 760, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.438140000442982e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..72c630fe0416ab807e17d190d912f456c9a103ea --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-780/trainer_state.json @@ -0,0 +1,853 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.8811104405552204, + "eval_steps": 20, + "global_step": 780, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.630070664764006e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0d60daf8a117ea26acefbfc13ecf0a374a566efd --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-80/trainer_state.json @@ -0,0 +1,118 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.19312009656004828, + "eval_steps": 20, + "global_step": 80, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7831350054199296.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d320f1c12511584678692fff34cc1089f3ef7f21 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-800/trainer_state.json @@ -0,0 +1,874 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.9293904646952322, + "eval_steps": 20, + "global_step": 800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 7.837527712807526e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..572182fe39f6aa01232f04fde5f1a5c21b57a3ba --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-820/trainer_state.json @@ -0,0 +1,895 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.9776704888352445, + "eval_steps": 20, + "global_step": 820, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.023625018272358e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a654c75ed9d5c6f778989ac4936b74d15c689fdf --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-840/trainer_state.json @@ -0,0 +1,916 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.024140012070006, + "eval_steps": 20, + "global_step": 840, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.22923995299287e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8829ebe513db3a620cb5ca7d2468bfd1310f78df --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-860/trainer_state.json @@ -0,0 +1,937 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.0724200362100182, + "eval_steps": 20, + "global_step": 860, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.435240854314394e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..46d0346f987385fa1e388a54558a355c1b462ce1 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-880/trainer_state.json @@ -0,0 +1,958 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.12070006035003, + "eval_steps": 20, + "global_step": 880, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.62381185481298e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bb6ce4ec88df402addec1e7f1d8dd1ef4b59a76d --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-900/trainer_state.json @@ -0,0 +1,979 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.1689800844900424, + "eval_steps": 20, + "global_step": 900, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 8.83278645335593e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..26353a6a075892360676c2cbb35c83267422ab47 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-920/trainer_state.json @@ -0,0 +1,1000 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.2172601086300543, + "eval_steps": 20, + "global_step": 920, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.051331269210317e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7307ea22dbcfbdcf38345bc9f1ad13100f94cc51 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-940/trainer_state.json @@ -0,0 +1,1021 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.2655401327700666, + "eval_steps": 20, + "global_step": 940, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.228428535297024e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..047f82ea637bfca91aae23266a9bc5e59153a7bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-960/trainer_state.json @@ -0,0 +1,1042 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.3138201569100785, + "eval_steps": 20, + "global_step": 960, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.419350423274496e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/README.md b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/adapter_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0dd029c541eac295dd0ee9608fbb57ff26a95c6c --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 128, + "lora_bias": false, + "lora_dropout": 0.03828026524568501, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 64, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "gate_proj", + "v_proj", + "up_proj", + "down_proj", + "o_proj", + "q_proj", + "k_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/chat_template.jinja b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/tokenizer_config.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/trainer_state.json b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..759f439bb68fcef1f4f7fb246f45e4acee490f6a --- /dev/null +++ b/overgeneralisation_original_Estonian/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-980/trainer_state.json @@ -0,0 +1,1063 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.3621001810500903, + "eval_steps": 20, + "global_step": 980, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 2.172999547421932, + "epoch": 0.04828002414001207, + "grad_norm": 2.5071208477020264, + "learning_rate": 1.7227585487708594e-05, + "loss": 1.9347333908081055, + "mean_token_accuracy": 0.6086816020309925, + "num_tokens": 47778.0, + "step": 20 + }, + { + "epoch": 0.04828002414001207, + "eval_entropy": 1.6909754791956269, + "eval_loss": 1.4728385210037231, + "eval_mean_token_accuracy": 0.6773593797442619, + "eval_num_tokens": 47778.0, + "eval_runtime": 90.1265, + "eval_samples_per_second": 15.756, + "eval_steps_per_second": 1.975, + "step": 20 + }, + { + "entropy": 1.2014626950025558, + "epoch": 0.09656004828002414, + "grad_norm": 1.5074543952941895, + "learning_rate": 3.5361886001086065e-05, + "loss": 1.0867146492004394, + "mean_token_accuracy": 0.7285927519202232, + "num_tokens": 95981.0, + "step": 40 + }, + { + "epoch": 0.09656004828002414, + "eval_entropy": 1.0304168352250302, + "eval_loss": 0.9211422204971313, + "eval_mean_token_accuracy": 0.7613122848312507, + "eval_num_tokens": 95981.0, + "eval_runtime": 88.6338, + "eval_samples_per_second": 16.021, + "eval_steps_per_second": 2.008, + "step": 40 + }, + { + "entropy": 0.9454198732972146, + "epoch": 0.14484007242003621, + "grad_norm": 1.7578108310699463, + "learning_rate": 5.349618651446354e-05, + "loss": 0.8447297096252442, + "mean_token_accuracy": 0.7723424732685089, + "num_tokens": 142784.0, + "step": 60 + }, + { + "epoch": 0.14484007242003621, + "eval_entropy": 0.8647834474451086, + "eval_loss": 0.8240737318992615, + "eval_mean_token_accuracy": 0.7821227014064789, + "eval_num_tokens": 142784.0, + "eval_runtime": 88.0135, + "eval_samples_per_second": 16.134, + "eval_steps_per_second": 2.022, + "step": 60 + }, + { + "entropy": 0.8963550612330436, + "epoch": 0.19312009656004828, + "grad_norm": 1.1464931964874268, + "learning_rate": 7.1630487027841e-05, + "loss": 0.7979836463928223, + "mean_token_accuracy": 0.7822489373385906, + "num_tokens": 187338.0, + "step": 80 + }, + { + "epoch": 0.19312009656004828, + "eval_entropy": 0.8663296133614657, + "eval_loss": 0.7752988338470459, + "eval_mean_token_accuracy": 0.7885957012015782, + "eval_num_tokens": 187338.0, + "eval_runtime": 88.284, + "eval_samples_per_second": 16.084, + "eval_steps_per_second": 2.016, + "step": 80 + }, + { + "entropy": 0.8265103206038475, + "epoch": 0.24140012070006034, + "grad_norm": 1.0106662511825562, + "learning_rate": 8.976478754121848e-05, + "loss": 0.7297060012817382, + "mean_token_accuracy": 0.7955138415098191, + "num_tokens": 236038.0, + "step": 100 + }, + { + "epoch": 0.24140012070006034, + "eval_entropy": 0.8122169536151244, + "eval_loss": 0.754906177520752, + "eval_mean_token_accuracy": 0.7917155255092664, + "eval_num_tokens": 236038.0, + "eval_runtime": 87.5754, + "eval_samples_per_second": 16.215, + "eval_steps_per_second": 2.033, + "step": 100 + }, + { + "entropy": 0.8098392844200134, + "epoch": 0.28968014484007243, + "grad_norm": 1.2238041162490845, + "learning_rate": 0.00010789908805459595, + "loss": 0.7201489448547364, + "mean_token_accuracy": 0.7975016921758652, + "num_tokens": 282918.0, + "step": 120 + }, + { + "epoch": 0.28968014484007243, + "eval_entropy": 0.8418726462326692, + "eval_loss": 0.7393178939819336, + "eval_mean_token_accuracy": 0.7936771585700217, + "eval_num_tokens": 282918.0, + "eval_runtime": 87.1597, + "eval_samples_per_second": 16.292, + "eval_steps_per_second": 2.042, + "step": 120 + }, + { + "entropy": 0.8080591082572937, + "epoch": 0.33796016898008446, + "grad_norm": 1.011591911315918, + "learning_rate": 0.00012603338856797343, + "loss": 0.7147697925567627, + "mean_token_accuracy": 0.7947175532579422, + "num_tokens": 331305.0, + "step": 140 + }, + { + "epoch": 0.33796016898008446, + "eval_entropy": 0.7894941431083037, + "eval_loss": 0.720219075679779, + "eval_mean_token_accuracy": 0.801899236239744, + "eval_num_tokens": 331305.0, + "eval_runtime": 87.1493, + "eval_samples_per_second": 16.294, + "eval_steps_per_second": 2.042, + "step": 140 + }, + { + "entropy": 0.7957205109298229, + "epoch": 0.38624019312009655, + "grad_norm": 0.8481830954551697, + "learning_rate": 0.00014416768908135088, + "loss": 0.7050027847290039, + "mean_token_accuracy": 0.7995368830859662, + "num_tokens": 375876.0, + "step": 160 + }, + { + "epoch": 0.38624019312009655, + "eval_entropy": 0.7746140591883928, + "eval_loss": 0.7175475358963013, + "eval_mean_token_accuracy": 0.7994848955213354, + "eval_num_tokens": 375876.0, + "eval_runtime": 86.655, + "eval_samples_per_second": 16.387, + "eval_steps_per_second": 2.054, + "step": 160 + }, + { + "entropy": 0.779565304517746, + "epoch": 0.43452021726010864, + "grad_norm": 1.032624363899231, + "learning_rate": 0.00016230198959472835, + "loss": 0.6978332042694092, + "mean_token_accuracy": 0.8015618294477462, + "num_tokens": 423913.0, + "step": 180 + }, + { + "epoch": 0.43452021726010864, + "eval_entropy": 0.7455583871080634, + "eval_loss": 0.7118850350379944, + "eval_mean_token_accuracy": 0.7999682195400923, + "eval_num_tokens": 423913.0, + "eval_runtime": 86.7842, + "eval_samples_per_second": 16.362, + "eval_steps_per_second": 2.051, + "step": 180 + }, + { + "entropy": 0.7810172818601131, + "epoch": 0.4828002414001207, + "grad_norm": 0.9276663064956665, + "learning_rate": 0.00018043629010810582, + "loss": 0.6937861442565918, + "mean_token_accuracy": 0.802893053740263, + "num_tokens": 472395.0, + "step": 200 + }, + { + "epoch": 0.4828002414001207, + "eval_entropy": 0.7650193290764027, + "eval_loss": 0.7020567059516907, + "eval_mean_token_accuracy": 0.8045302153973097, + "eval_num_tokens": 472395.0, + "eval_runtime": 88.326, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 200 + }, + { + "entropy": 0.7862060204148292, + "epoch": 0.5310802655401328, + "grad_norm": 0.8195295929908752, + "learning_rate": 0.0001985705906214833, + "loss": 0.6878782272338867, + "mean_token_accuracy": 0.8027168907225132, + "num_tokens": 517049.0, + "step": 220 + }, + { + "epoch": 0.5310802655401328, + "eval_entropy": 0.7656565583154057, + "eval_loss": 0.6973932981491089, + "eval_mean_token_accuracy": 0.8047967278555538, + "eval_num_tokens": 517049.0, + "eval_runtime": 87.7698, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 220 + }, + { + "entropy": 0.7611534461379051, + "epoch": 0.5793602896801449, + "grad_norm": 0.7499712109565735, + "learning_rate": 0.00021670489113486077, + "loss": 0.681937837600708, + "mean_token_accuracy": 0.8041978515684605, + "num_tokens": 562836.0, + "step": 240 + }, + { + "epoch": 0.5793602896801449, + "eval_entropy": 0.7599442380197933, + "eval_loss": 0.7002046704292297, + "eval_mean_token_accuracy": 0.8051861517884759, + "eval_num_tokens": 562836.0, + "eval_runtime": 87.9239, + "eval_samples_per_second": 16.15, + "eval_steps_per_second": 2.024, + "step": 240 + }, + { + "entropy": 0.7800783462822437, + "epoch": 0.627640313820157, + "grad_norm": 0.8645269274711609, + "learning_rate": 0.00023483919164823825, + "loss": 0.6954500675201416, + "mean_token_accuracy": 0.8031484372913837, + "num_tokens": 606612.0, + "step": 260 + }, + { + "epoch": 0.627640313820157, + "eval_entropy": 0.7498679090751691, + "eval_loss": 0.7046149373054504, + "eval_mean_token_accuracy": 0.802388215667746, + "eval_num_tokens": 606612.0, + "eval_runtime": 88.2468, + "eval_samples_per_second": 16.091, + "eval_steps_per_second": 2.017, + "step": 260 + }, + { + "entropy": 0.7586533665657044, + "epoch": 0.6759203379601689, + "grad_norm": 0.741596519947052, + "learning_rate": 0.0002529734921616157, + "loss": 0.690476369857788, + "mean_token_accuracy": 0.8046923100948333, + "num_tokens": 655920.0, + "step": 280 + }, + { + "epoch": 0.6759203379601689, + "eval_entropy": 0.7714274066887544, + "eval_loss": 0.6992160677909851, + "eval_mean_token_accuracy": 0.8042646482419432, + "eval_num_tokens": 655920.0, + "eval_runtime": 88.1754, + "eval_samples_per_second": 16.104, + "eval_steps_per_second": 2.019, + "step": 280 + }, + { + "entropy": 0.7585848286747933, + "epoch": 0.724200362100181, + "grad_norm": 1.0778124332427979, + "learning_rate": 0.00027110779267499317, + "loss": 0.6790409564971924, + "mean_token_accuracy": 0.8060351841151714, + "num_tokens": 702638.0, + "step": 300 + }, + { + "epoch": 0.724200362100181, + "eval_entropy": 0.7380402811457601, + "eval_loss": 0.7054820656776428, + "eval_mean_token_accuracy": 0.8003534738267406, + "eval_num_tokens": 702638.0, + "eval_runtime": 88.238, + "eval_samples_per_second": 16.093, + "eval_steps_per_second": 2.017, + "step": 300 + }, + { + "entropy": 0.7696981988847256, + "epoch": 0.7724803862401931, + "grad_norm": 0.8408658504486084, + "learning_rate": 0.00028924209318837064, + "loss": 0.7070387363433838, + "mean_token_accuracy": 0.8035947173833847, + "num_tokens": 749377.0, + "step": 320 + }, + { + "epoch": 0.7724803862401931, + "eval_entropy": 0.7897409023193831, + "eval_loss": 0.7015668749809265, + "eval_mean_token_accuracy": 0.805306687113944, + "eval_num_tokens": 749377.0, + "eval_runtime": 87.9395, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 320 + }, + { + "entropy": 0.762337189912796, + "epoch": 0.8207604103802052, + "grad_norm": 0.9843310117721558, + "learning_rate": 0.0003073763937017481, + "loss": 0.7021088123321533, + "mean_token_accuracy": 0.8029616877436638, + "num_tokens": 798874.0, + "step": 340 + }, + { + "epoch": 0.8207604103802052, + "eval_entropy": 0.7210077121016685, + "eval_loss": 0.7082746624946594, + "eval_mean_token_accuracy": 0.8049283824609906, + "eval_num_tokens": 798874.0, + "eval_runtime": 88.1706, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 340 + }, + { + "entropy": 0.7879025422036647, + "epoch": 0.8690404345202173, + "grad_norm": 0.9713814854621887, + "learning_rate": 0.0003255106942151256, + "loss": 0.714624547958374, + "mean_token_accuracy": 0.79987031519413, + "num_tokens": 840825.0, + "step": 360 + }, + { + "epoch": 0.8690404345202173, + "eval_entropy": 0.7866930489459735, + "eval_loss": 0.7145519852638245, + "eval_mean_token_accuracy": 0.8015657988157165, + "eval_num_tokens": 840825.0, + "eval_runtime": 88.3746, + "eval_samples_per_second": 16.068, + "eval_steps_per_second": 2.014, + "step": 360 + }, + { + "entropy": 0.7844726584851742, + "epoch": 0.9173204586602294, + "grad_norm": 1.2028311491012573, + "learning_rate": 0.00034364499472850306, + "loss": 0.7040786266326904, + "mean_token_accuracy": 0.7981885217130185, + "num_tokens": 882885.0, + "step": 380 + }, + { + "epoch": 0.9173204586602294, + "eval_entropy": 0.7767668339643585, + "eval_loss": 0.7073574066162109, + "eval_mean_token_accuracy": 0.8040851833445303, + "eval_num_tokens": 882885.0, + "eval_runtime": 88.3828, + "eval_samples_per_second": 16.066, + "eval_steps_per_second": 2.014, + "step": 380 + }, + { + "entropy": 0.7699790760874748, + "epoch": 0.9656004828002414, + "grad_norm": 0.9397398233413696, + "learning_rate": 0.00036177929524188054, + "loss": 0.7040313720703125, + "mean_token_accuracy": 0.8034727744758129, + "num_tokens": 927456.0, + "step": 400 + }, + { + "epoch": 0.9656004828002414, + "eval_entropy": 0.7749103545472863, + "eval_loss": 0.7093513011932373, + "eval_mean_token_accuracy": 0.8019482901926791, + "eval_num_tokens": 927456.0, + "eval_runtime": 86.2112, + "eval_samples_per_second": 16.471, + "eval_steps_per_second": 2.065, + "step": 400 + }, + { + "entropy": 0.7672389172888422, + "epoch": 1.012070006035003, + "grad_norm": 0.99210524559021, + "learning_rate": 0.00037628567078152296, + "loss": 0.6913118362426758, + "mean_token_accuracy": 0.8042210944287189, + "num_tokens": 972662.0, + "step": 420 + }, + { + "epoch": 1.012070006035003, + "eval_entropy": 0.7294771229283193, + "eval_loss": 0.7171520590782166, + "eval_mean_token_accuracy": 0.8015128585059991, + "eval_num_tokens": 972662.0, + "eval_runtime": 88.037, + "eval_samples_per_second": 16.13, + "eval_steps_per_second": 2.022, + "step": 420 + }, + { + "entropy": 0.7143943183124065, + "epoch": 1.060350030175015, + "grad_norm": 1.087638258934021, + "learning_rate": 0.0003762484015601069, + "loss": 0.642704439163208, + "mean_token_accuracy": 0.8124966286122799, + "num_tokens": 1022525.0, + "step": 440 + }, + { + "epoch": 1.060350030175015, + "eval_entropy": 0.743511886744017, + "eval_loss": 0.7116662859916687, + "eval_mean_token_accuracy": 0.8037210672758939, + "eval_num_tokens": 1022525.0, + "eval_runtime": 87.9931, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 440 + }, + { + "entropy": 0.7237346574664116, + "epoch": 1.1086300543150271, + "grad_norm": 0.9365553259849548, + "learning_rate": 0.0003761579008392123, + "loss": 0.652644681930542, + "mean_token_accuracy": 0.8107496216893196, + "num_tokens": 1069194.0, + "step": 460 + }, + { + "epoch": 1.1086300543150271, + "eval_entropy": 0.7372823839776972, + "eval_loss": 0.7238303422927856, + "eval_mean_token_accuracy": 0.8026230124275336, + "eval_num_tokens": 1069194.0, + "eval_runtime": 87.6778, + "eval_samples_per_second": 16.196, + "eval_steps_per_second": 2.03, + "step": 460 + }, + { + "entropy": 0.7202137842774391, + "epoch": 1.1569100784550392, + "grad_norm": 0.7998443841934204, + "learning_rate": 0.0003760141942294726, + "loss": 0.6485219478607178, + "mean_token_accuracy": 0.8092714451253414, + "num_tokens": 1117570.0, + "step": 480 + }, + { + "epoch": 1.1569100784550392, + "eval_entropy": 0.71547647942318, + "eval_loss": 0.7124277949333191, + "eval_mean_token_accuracy": 0.8013174219077892, + "eval_num_tokens": 1117570.0, + "eval_runtime": 87.4387, + "eval_samples_per_second": 16.24, + "eval_steps_per_second": 2.036, + "step": 480 + }, + { + "entropy": 0.7270819500088692, + "epoch": 1.2051901025950513, + "grad_norm": 0.9470787644386292, + "learning_rate": 0.00037581732239815854, + "loss": 0.66352219581604, + "mean_token_accuracy": 0.8102593503892421, + "num_tokens": 1161717.0, + "step": 500 + }, + { + "epoch": 1.2051901025950513, + "eval_entropy": 0.7791565897759427, + "eval_loss": 0.7179726958274841, + "eval_mean_token_accuracy": 0.7948898328154275, + "eval_num_tokens": 1161717.0, + "eval_runtime": 87.9927, + "eval_samples_per_second": 16.138, + "eval_steps_per_second": 2.023, + "step": 500 + }, + { + "entropy": 0.7320936664938926, + "epoch": 1.2534701267350634, + "grad_norm": 1.0220379829406738, + "learning_rate": 0.0003755673410576695, + "loss": 0.6581549644470215, + "mean_token_accuracy": 0.8098709337413311, + "num_tokens": 1209390.0, + "step": 520 + }, + { + "epoch": 1.2534701267350634, + "eval_entropy": 0.7710678225822662, + "eval_loss": 0.708797812461853, + "eval_mean_token_accuracy": 0.8039572778042783, + "eval_num_tokens": 1209390.0, + "eval_runtime": 88.1193, + "eval_samples_per_second": 16.115, + "eval_steps_per_second": 2.02, + "step": 520 + }, + { + "entropy": 0.7281674664467573, + "epoch": 1.3017501508750755, + "grad_norm": 0.8775188326835632, + "learning_rate": 0.000375264320949768, + "loss": 0.6631278991699219, + "mean_token_accuracy": 0.8101261422038079, + "num_tokens": 1256611.0, + "step": 540 + }, + { + "epoch": 1.3017501508750755, + "eval_entropy": 0.7199799800187014, + "eval_loss": 0.6981531381607056, + "eval_mean_token_accuracy": 0.8071265254127845, + "eval_num_tokens": 1256611.0, + "eval_runtime": 88.165, + "eval_samples_per_second": 16.106, + "eval_steps_per_second": 2.019, + "step": 540 + }, + { + "entropy": 0.722860773652792, + "epoch": 1.3500301750150876, + "grad_norm": 0.8949288129806519, + "learning_rate": 0.00037490834782556, + "loss": 0.6639598846435547, + "mean_token_accuracy": 0.8105649061501026, + "num_tokens": 1302325.0, + "step": 560 + }, + { + "epoch": 1.3500301750150876, + "eval_entropy": 0.7134760032209118, + "eval_loss": 0.7029948234558105, + "eval_mean_token_accuracy": 0.8062985880991046, + "eval_num_tokens": 1302325.0, + "eval_runtime": 88.1286, + "eval_samples_per_second": 16.113, + "eval_steps_per_second": 2.02, + "step": 560 + }, + { + "entropy": 0.7299126699566841, + "epoch": 1.3983101991550995, + "grad_norm": 1.0323039293289185, + "learning_rate": 0.0003744995224212291, + "loss": 0.6535763263702392, + "mean_token_accuracy": 0.8120224848389626, + "num_tokens": 1343844.0, + "step": 580 + }, + { + "epoch": 1.3983101991550995, + "eval_entropy": 0.7169701182440426, + "eval_loss": 0.7067857980728149, + "eval_mean_token_accuracy": 0.8040432936689826, + "eval_num_tokens": 1343844.0, + "eval_runtime": 88.2252, + "eval_samples_per_second": 16.095, + "eval_steps_per_second": 2.018, + "step": 580 + }, + { + "entropy": 0.7281742256134749, + "epoch": 1.4465902232951118, + "grad_norm": 1.3370424509048462, + "learning_rate": 0.00037403796042952863, + "loss": 0.6637272357940673, + "mean_token_accuracy": 0.8118261776864528, + "num_tokens": 1389471.0, + "step": 600 + }, + { + "epoch": 1.4465902232951118, + "eval_entropy": 0.7378843212395572, + "eval_loss": 0.7038390040397644, + "eval_mean_token_accuracy": 0.8059229371922739, + "eval_num_tokens": 1389471.0, + "eval_runtime": 87.9301, + "eval_samples_per_second": 16.149, + "eval_steps_per_second": 2.024, + "step": 600 + }, + { + "entropy": 0.7388614989817143, + "epoch": 1.4948702474351236, + "grad_norm": 0.8464171290397644, + "learning_rate": 0.00037352379246704257, + "loss": 0.6604740142822265, + "mean_token_accuracy": 0.8102974124252796, + "num_tokens": 1435975.0, + "step": 620 + }, + { + "epoch": 1.4948702474351236, + "eval_entropy": 0.7126847046814607, + "eval_loss": 0.6950703263282776, + "eval_mean_token_accuracy": 0.8085885392815879, + "eval_num_tokens": 1435975.0, + "eval_runtime": 88.2732, + "eval_samples_per_second": 16.086, + "eval_steps_per_second": 2.016, + "step": 620 + }, + { + "entropy": 0.7258916139602661, + "epoch": 1.5431502715751357, + "grad_norm": 1.1780085563659668, + "learning_rate": 0.0003729571640372223, + "loss": 0.6529891014099121, + "mean_token_accuracy": 0.8085981778800487, + "num_tokens": 1482035.0, + "step": 640 + }, + { + "epoch": 1.5431502715751357, + "eval_entropy": 0.7096509638797032, + "eval_loss": 0.690051257610321, + "eval_mean_token_accuracy": 0.8100520241796301, + "eval_num_tokens": 1482035.0, + "eval_runtime": 88.3153, + "eval_samples_per_second": 16.079, + "eval_steps_per_second": 2.016, + "step": 640 + }, + { + "entropy": 0.7151173129677773, + "epoch": 1.5914302957151478, + "grad_norm": 1.0357667207717896, + "learning_rate": 0.0003723382354892108, + "loss": 0.6451474189758301, + "mean_token_accuracy": 0.8136902332305909, + "num_tokens": 1528119.0, + "step": 660 + }, + { + "epoch": 1.5914302957151478, + "eval_entropy": 0.7060252652409371, + "eval_loss": 0.6899483799934387, + "eval_mean_token_accuracy": 0.810834194502134, + "eval_num_tokens": 1528119.0, + "eval_runtime": 87.8848, + "eval_samples_per_second": 16.158, + "eval_steps_per_second": 2.025, + "step": 660 + }, + { + "entropy": 0.7141377851366997, + "epoch": 1.63971031985516, + "grad_norm": 0.8391667008399963, + "learning_rate": 0.000371667181972466, + "loss": 0.6481579780578614, + "mean_token_accuracy": 0.8159015104174614, + "num_tokens": 1573661.0, + "step": 680 + }, + { + "epoch": 1.63971031985516, + "eval_entropy": 0.7598993319473909, + "eval_loss": 0.681204080581665, + "eval_mean_token_accuracy": 0.8100194586126992, + "eval_num_tokens": 1573661.0, + "eval_runtime": 88.2415, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 680 + }, + { + "entropy": 0.7235980287194252, + "epoch": 1.687990343995172, + "grad_norm": 0.8197196125984192, + "learning_rate": 0.00037094419338719537, + "loss": 0.6582849025726318, + "mean_token_accuracy": 0.8114834539592266, + "num_tokens": 1621714.0, + "step": 700 + }, + { + "epoch": 1.687990343995172, + "eval_entropy": 0.7166854568411795, + "eval_loss": 0.679177463054657, + "eval_mean_token_accuracy": 0.8119039877077167, + "eval_num_tokens": 1621714.0, + "eval_runtime": 88.0957, + "eval_samples_per_second": 16.119, + "eval_steps_per_second": 2.021, + "step": 700 + }, + { + "entropy": 0.7278190158307553, + "epoch": 1.736270368135184, + "grad_norm": 0.7820602655410767, + "learning_rate": 0.0003701694743306164, + "loss": 0.6633153438568116, + "mean_token_accuracy": 0.8123249113559723, + "num_tokens": 1672118.0, + "step": 720 + }, + { + "epoch": 1.736270368135184, + "eval_entropy": 0.6980850314826108, + "eval_loss": 0.6775653958320618, + "eval_mean_token_accuracy": 0.8116872906684875, + "eval_num_tokens": 1672118.0, + "eval_runtime": 87.9795, + "eval_samples_per_second": 16.14, + "eval_steps_per_second": 2.023, + "step": 720 + }, + { + "entropy": 0.7149631556123495, + "epoch": 1.7845503922751962, + "grad_norm": 1.0139760971069336, + "learning_rate": 0.00036934324403905795, + "loss": 0.6468976020812989, + "mean_token_accuracy": 0.8117561548948288, + "num_tokens": 1720465.0, + "step": 740 + }, + { + "epoch": 1.7845503922751962, + "eval_entropy": 0.69009849094273, + "eval_loss": 0.6731093525886536, + "eval_mean_token_accuracy": 0.81281964196248, + "eval_num_tokens": 1720465.0, + "eval_runtime": 87.7412, + "eval_samples_per_second": 16.184, + "eval_steps_per_second": 2.029, + "step": 740 + }, + { + "entropy": 0.7226049453020096, + "epoch": 1.832830416415208, + "grad_norm": 1.5040546655654907, + "learning_rate": 0.0003684657363259193, + "loss": 0.6385328769683838, + "mean_token_accuracy": 0.8132639616727829, + "num_tokens": 1764440.0, + "step": 760 + }, + { + "epoch": 1.832830416415208, + "eval_entropy": 0.7125169618076153, + "eval_loss": 0.6864680647850037, + "eval_mean_token_accuracy": 0.8049418089095126, + "eval_num_tokens": 1764440.0, + "eval_runtime": 87.9429, + "eval_samples_per_second": 16.147, + "eval_steps_per_second": 2.024, + "step": 760 + }, + { + "entropy": 0.707821810990572, + "epoch": 1.8811104405552204, + "grad_norm": 0.8604223132133484, + "learning_rate": 0.00036753719951550327, + "loss": 0.6397049427032471, + "mean_token_accuracy": 0.8137877315282822, + "num_tokens": 1810828.0, + "step": 780 + }, + { + "epoch": 1.8811104405552204, + "eval_entropy": 0.6492102551326323, + "eval_loss": 0.6743726134300232, + "eval_mean_token_accuracy": 0.8130356572317273, + "eval_num_tokens": 1810828.0, + "eval_runtime": 87.8684, + "eval_samples_per_second": 16.161, + "eval_steps_per_second": 2.026, + "step": 780 + }, + { + "entropy": 0.6800355084240437, + "epoch": 1.9293904646952322, + "grad_norm": 0.7270982265472412, + "learning_rate": 0.00036655789637274377, + "loss": 0.6267755031585693, + "mean_token_accuracy": 0.8180945307016373, + "num_tokens": 1857600.0, + "step": 800 + }, + { + "epoch": 1.9293904646952322, + "eval_entropy": 0.6727538651294922, + "eval_loss": 0.6696028709411621, + "eval_mean_token_accuracy": 0.8116443090224534, + "eval_num_tokens": 1857600.0, + "eval_runtime": 88.2449, + "eval_samples_per_second": 16.092, + "eval_steps_per_second": 2.017, + "step": 800 + }, + { + "entropy": 0.6746691606938839, + "epoch": 1.9776704888352445, + "grad_norm": 0.9771540760993958, + "learning_rate": 0.0003655281040288461, + "loss": 0.6326992988586426, + "mean_token_accuracy": 0.8179976396262646, + "num_tokens": 1901998.0, + "step": 820 + }, + { + "epoch": 1.9776704888352445, + "eval_entropy": 0.6636319716324967, + "eval_loss": 0.6714363098144531, + "eval_mean_token_accuracy": 0.8126635943235976, + "eval_num_tokens": 1901998.0, + "eval_runtime": 87.7666, + "eval_samples_per_second": 16.179, + "eval_steps_per_second": 2.028, + "step": 820 + }, + { + "entropy": 0.6319125778489298, + "epoch": 2.024140012070006, + "grad_norm": 0.8380444645881653, + "learning_rate": 0.0003644481139028622, + "loss": 0.5780903816223144, + "mean_token_accuracy": 0.8250188401767186, + "num_tokens": 1947553.0, + "step": 840 + }, + { + "epoch": 2.024140012070006, + "eval_entropy": 0.6627151989535, + "eval_loss": 0.6774935722351074, + "eval_mean_token_accuracy": 0.8140510819601209, + "eval_num_tokens": 1947553.0, + "eval_runtime": 87.8287, + "eval_samples_per_second": 16.168, + "eval_steps_per_second": 2.027, + "step": 840 + }, + { + "entropy": 0.6059147048741579, + "epoch": 2.0724200362100182, + "grad_norm": 0.9745152592658997, + "learning_rate": 0.0003633182316192229, + "loss": 0.546702527999878, + "mean_token_accuracy": 0.8358186542987823, + "num_tokens": 1995234.0, + "step": 860 + }, + { + "epoch": 2.0724200362100182, + "eval_entropy": 0.6620710384979677, + "eval_loss": 0.6769291162490845, + "eval_mean_token_accuracy": 0.8135082835561773, + "eval_num_tokens": 1995234.0, + "eval_runtime": 88.0008, + "eval_samples_per_second": 16.136, + "eval_steps_per_second": 2.023, + "step": 860 + }, + { + "entropy": 0.6076117843389511, + "epoch": 2.12070006035003, + "grad_norm": 0.6914380192756653, + "learning_rate": 0.0003621387769212491, + "loss": 0.5324535846710206, + "mean_token_accuracy": 0.8366568259894848, + "num_tokens": 2040639.0, + "step": 880 + }, + { + "epoch": 2.12070006035003, + "eval_entropy": 0.6592224213514435, + "eval_loss": 0.670383632183075, + "eval_mean_token_accuracy": 0.8162150088320957, + "eval_num_tokens": 2040639.0, + "eval_runtime": 88.324, + "eval_samples_per_second": 16.077, + "eval_steps_per_second": 2.015, + "step": 880 + }, + { + "entropy": 0.6158072650432587, + "epoch": 2.1689800844900424, + "grad_norm": 0.9649198055267334, + "learning_rate": 0.0003609100835806688, + "loss": 0.5564568996429443, + "mean_token_accuracy": 0.8329654954373836, + "num_tokens": 2090604.0, + "step": 900 + }, + { + "epoch": 2.1689800844900424, + "eval_entropy": 0.608588819758276, + "eval_loss": 0.6745102405548096, + "eval_mean_token_accuracy": 0.8155080542135774, + "eval_num_tokens": 2090604.0, + "eval_runtime": 87.52, + "eval_samples_per_second": 16.225, + "eval_steps_per_second": 2.034, + "step": 900 + }, + { + "entropy": 0.5938734326511621, + "epoch": 2.2172601086300543, + "grad_norm": 0.6915557384490967, + "learning_rate": 0.0003596324993031632, + "loss": 0.5351875782012939, + "mean_token_accuracy": 0.8385631121695042, + "num_tokens": 2142246.0, + "step": 920 + }, + { + "epoch": 2.2172601086300543, + "eval_entropy": 0.6251631205001574, + "eval_loss": 0.6664518117904663, + "eval_mean_token_accuracy": 0.81711940417129, + "eval_num_tokens": 2142246.0, + "eval_runtime": 87.1792, + "eval_samples_per_second": 16.288, + "eval_steps_per_second": 2.042, + "step": 920 + }, + { + "entropy": 0.623173613846302, + "epoch": 2.2655401327700666, + "grad_norm": 0.8366610407829285, + "learning_rate": 0.00035830638562997063, + "loss": 0.5488213539123535, + "mean_token_accuracy": 0.8321483485400677, + "num_tokens": 2183144.0, + "step": 940 + }, + { + "epoch": 2.2655401327700666, + "eval_entropy": 0.6237085649136747, + "eval_loss": 0.68075031042099, + "eval_mean_token_accuracy": 0.814671738429016, + "eval_num_tokens": 2183144.0, + "eval_runtime": 88.0652, + "eval_samples_per_second": 16.124, + "eval_steps_per_second": 2.021, + "step": 940 + }, + { + "entropy": 0.6236911740154027, + "epoch": 2.3138201569100785, + "grad_norm": 0.7812452912330627, + "learning_rate": 0.00035693211783557416, + "loss": 0.5696200847625732, + "mean_token_accuracy": 0.82991396561265, + "num_tokens": 2228098.0, + "step": 960 + }, + { + "epoch": 2.3138201569100785, + "eval_entropy": 0.6327033426319615, + "eval_loss": 0.6742984652519226, + "eval_mean_token_accuracy": 0.8148086091105857, + "eval_num_tokens": 2228098.0, + "eval_runtime": 88.1711, + "eval_samples_per_second": 16.105, + "eval_steps_per_second": 2.019, + "step": 960 + }, + { + "entropy": 0.6218426413834095, + "epoch": 2.3621001810500903, + "grad_norm": 0.8719790577888489, + "learning_rate": 0.0003555100848215035, + "loss": 0.5582651615142822, + "mean_token_accuracy": 0.8323961742222309, + "num_tokens": 2273062.0, + "step": 980 + }, + { + "epoch": 2.3621001810500903, + "eval_entropy": 0.6338012375858393, + "eval_loss": 0.6685822606086731, + "eval_mean_token_accuracy": 0.8152180300669724, + "eval_num_tokens": 2273062.0, + "eval_runtime": 88.101, + "eval_samples_per_second": 16.118, + "eval_steps_per_second": 2.02, + "step": 980 + } + ], + "logging_steps": 20, + "max_steps": 4150, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 9.613105656982118e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +}